تولّد صورة شخصية في Stable Diffusion. التكوين متماسك، والإضاءة درامية، لكن الوجه غير صحيح. البشرة بلا مسام، وسطحها يعكس الضوء مثل دمية عرض. كل تفصيل مصقول أكثر من اللازم: ذلك «المظهر البلاستيكي للذكاء الاصطناعي» الذي يكشف فوراً أن الصورة مولّدة آلياً.
يشرح هذا الدليل سبب حدوث ذلك، وأي نماذج واقعية في Stable Diffusion تعالج المشكلة فعلاً، والإعدادات وتقنيات المعالجة اللاحقة التي تفصل بين نتيجة فوتوغرافية واقعية وأخرى بلاستيكية.
لماذا تبدو صور Stable Diffusion بلاستيكية؟
المظهر البلاستيكي ليس فشلاً واحداً، بل نتيجة ثلاثة عوامل متداخلة يفاقم كل منها الآخر.
انحياز بيانات التدريب. دُرّبت النماذج الأساسية مثل SDXL وSD 1.5 على ملايين الصور، وكثير منها صور مخزون منقّحة رقمياً أو رسوم ملساء أو صور مولّدة بالذكاء الاصطناعي أُعيد إدخالها إلى مجموعة التدريب. يتعلم النموذج أن البشرة الناعمة الخالية من العيوب هي الوضع الافتراضي لأنها تهيمن على توزيع بياناته. تعالج checkpointات الواقعية المضبوطة هذا الانحياز بالتدريب تحديداً على صور غير منقّحة تظهر ملمس البشرة والمسام والعيوب الطبيعية.
تفاعل sampler مع CFG. تجبر قيم CFG الأعلى من 7 النموذج على الالتزام الصارم بالمطالبة، وغالباً ما يعني ذلك إنتاج نسخة مثالية مبالغاً فيها من كل مفهوم، بما في ذلك البشرة. قيمة CFG تساوي 8 أو أكثر في مطالبة لصورة شخصية تكبت فعلياً الضوضاء عالية التردد التي تتحول إلى مسام وعيوب وملمس دقيق. ومع samplerات تعطي الأولوية للتماسك على حساب التفاصيل، تحصل على أسطح ملساء كالزجاج تبدو مصطنعة عند التدقيق.
غياب negative prompts. من دون إخبار النموذج صراحةً بما يجب تجنبه، لا توجد إشارة إلى أن البشرة البلاستيكية أو الملساء أو المعالجة بالفرشاة أو الشبيهة بالدمى غير مرغوبة. لا تقتصر negative prompts على إزالة الأصابع الزائدة؛ فهي أداة مباشرة للتحكم في واقعية البشرة.

أفضل النماذج الواقعية في Stable Diffusion حالياً
ليست كل checkpointات مصممة للواقعية الفوتوغرافية. اكتسبت النماذج أدناه سمعتها بفضل جودة المخرجات المتسقة والتحقق النشط من المجتمع وأرقام التنزيل القابلة للقياس على Civitai. ويتفوق كل نموذج في جانب مختلف من الواقعية.
| النموذج | البنية | الحد الأدنى لـ VRAM | الأفضل لـ | نقطة القوة الرئيسية |
|---|---|---|---|---|
| RealVisXL V5.0 | SDXL 1.0 | 8 GB | الصور الشخصية واللقطات القريبة | مظهر فيلم طبيعي وملمس بشرة واقعي |
| Juggernaut XL v10 | SDXL 1.0 | 8 GB | الواقعية الفوتوغرافية المتنوعة | إضاءة سينمائية ونطاق واسع للمطالبات |
| Realistic Vision V6.0 | SD 1.5 | 4 GB | الواقعية على الأجهزة الضعيفة | يعمل على 4 GB ويدعم منظومة LoRA ضخمة |
| CyberRealistic XL v10 | SDXL 1.0 | 8 GB | واقعية نظيفة وتكرار سريع | دعم LCM/Lightning ومخرجات حادة |
| EpicRealism | SD 1.5 / SDXL | 4-8 GB | التفاصيل الدقيقة والإضاءة الطبيعية | يتجنب زيادة الحدة ودرجاته حيوية |
يبقى RealVisXL V5.0 الخيار الأول للمجتمع في الصور الشخصية، إذ ينتج بشرة تصمد أمام التدقيق بتركيب حبيبي طبيعي يذكّر بفيلم 35mm. أما Juggernaut XL v10 فهو أكثر checkpointات SDXL تنوعاً. وإن لم تعرف من أين تبدأ، فهو يتعامل بثبات مع كل شيء من الصور الشخصية إلى تصوير المنتجات، وقد تجاوز 18 مليون تنزيل.
Realistic Vision V6.0 هو أسطورة SD 1.5 التي ترفض الاعتزال: يعمل على جهاز GPU متواضع بذاكرة 4 GB، ويقدم رغم ذلك ألوان بشرة وإضاءة تنافس نماذج SDXL بدقات أقل. يوفّر CyberRealistic XL نسخ LCM وLightning لمن يحتاجون إلى تكرار سريع من دون التضحية بالواقعية الفوتوغرافية. وتكمل EpicRealism القائمة بنهجها المتزن عمداً، إذ تتجنب فخ زيادة الحدة الذي يجعل نماذج أخرى تبدو مصقولة بأسلوب الذكاء الاصطناعي.
اختيار النموذج المناسب لجهازك
لا معنى لاختيار نموذج لا يستطيع GPU لديك تشغيله. إطار القرار العملي بسيط: طابق فئة VRAM مع البنية المناسبة أولاً، ثم حسّن الواقعية ضمن تلك الفئة.
| فئة VRAM | البنية الموصى بها | أفضل نموذج واقعي | ما يمكن توقعه |
|---|---|---|---|
| 4-6 GB | SD 1.5 | Realistic Vision V6.0 | 512x512 أصلي، توليد سريع، ألوان بشرة ممتازة، دقة محدودة |
| 8 GB | SDXL | Juggernaut XL v10 أو RealVisXL V5.0 | 1024x1024 أصلي، تفاصيل قوية، قد تحتاج إلى إدارة VRAM عند تكديس LoRA |
| 12 GB+ | SDXL براحة أو Flux | أي checkpoint لـ SDXL مع حزمة LoRA كاملة | سير عمل متعدد LoRA وControlNet وADetailer معاً |
| 16 GB+ | Flux أو SDXL | Flux Dev GGUF Q8 | أفضل واقعية محلية متاحة، تشريح والتزام بالمطالبة أفضل |
يحتاج SDXL إلى 8 GB لمجرد التحميل وإلى 12 GB للعمل من دون إدارة مستمرة للـVRAM. إذا كانت لديك 6 GB أو أقل فلا تحاربه. نماذج SD 1.5 مثل Realistic Vision محسّنة للذاكرة الأقل، وما زالت تنتج واقعية ممتازة عند 512x512 ويمكن رفع دقتها لاحقاً. يظهر الانتقال من SD 1.5 إلى SDXL فوراً في التشريح والتفاصيل وفهم المطالبة، لكن تكلفة VRAM ترتفع بالقدر نفسه تقريباً.
الإعدادات الأساسية للحصول على صور واقعية
اختيار checkpoint المناسب هو الخطوة الأولى فقط. فالـsampler ومقياس CFG وعدد الخطوات وnegative prompt التي تقرنها به تحدد ما إذا كانت النتيجة تبدو صورة فوتوغرافية أم تصييراً رقمياً.
Sampler. يُجمع المجتمع على DPM++ 2M SDE Karras وDPM++ 3M SDE Karras كأفضل خيارين لملمس البشرة. تحافظ هذه samplerات على التفاصيل عالية التردد، أي الضوضاء الدقيقة التي تتحول إلى مسام وحبيبات وعدم انتظام سطحي. يميل Euler a وDDIM إلى نتائج أنعم، وهو عكس ما تحتاجه للواقعية الفوتوغرافية.
مقياس CFG. في صور SDXL الشخصية، ينتج CFG بين 4 و7 البشرة الأكثر طبيعية. تجاوزه 7 يدفع النموذج نحو مخرجات مثالية ونظيفة أكثر من اللازم. ويحقق بعض الممارسين نتائج ممتازة عند CFG بين 2 و3 مع negative prompts مضبوطة بعناية، ما يمنح النموذج حرية أكبر لتوليد ملمس طبيعي على حساب الالتزام الصارم بالمطالبة.
الخطوات. نطاق 25-30 خطوة هو المعيار في SDXL. وللحصول على أقصى تفاصيل للبشرة، يؤدي رفع العدد إلى 40-60 خطوة مع DPM++ 3M SDE Karras إلى تحسن واضح في تعريف المسام ورسم الشعر. بعد 60 خطوة تتناقص الفائدة بشدة. يمكن لنسخ Lightning وLCM إنتاج نتائج قابلة للاستخدام في 4-8 خطوات، لكنها أفضل للتجريب لا للمخرج النهائي.
Negative prompts. هنا يُقضى على معظم المظهر البلاستيكي. تتضمن negative prompt قوية للصور الشخصية الواقعية ما يلي:
plastic, smooth skin, airbrushed, poreless, doll-like, flawless, perfect skin3d render, cgi, digital painting, illustration, cartoon, animeblurry, low quality, deformed, bad anatomy, extra fingers, mutated handswax, retouched, photoshop, overexposed
يستهدف السطر الأول المظهر البلاستيكي مباشرةً. ويزيل الثاني الأنماط غير الفوتوغرافية. ويتعامل الثالث مع الأخطاء البنيوية. أما الرابع فيلغي مظهر المعالجة اللاحقة المصقول أكثر من اللازم، والذي يجعل الصور تبدو مصطنعة حتى عندما يكون التوليد الأساسي جيداً.

ما بعد الـ checkpoint: LoRA وADetailer وهندسة البرومبتات
حتى مع النموذج والإعدادات المناسبة، تفقد الوجوه التفاصيل غالباً عند الدقات القياسية. لذلك طوّر المجتمع نهجاً متعدد الطبقات للمعالجة اللاحقة يعالج المشكلة بشكل منهجي.
LoRA للواقعية. تحقن نماذج LoRA الخفيفة مثل Skin & Hand من Polyhedron وadd-details-xl ملمس البشرة والتفاصيل الدقيقة بأوزان منخفضة من 0.3 إلى 0.8. عند وزن 1.0 يجبر add-details-xl النموذج على رسم تفاصيل عالية التردد في الصورة كلها، ما قد يغير البشرة جذرياً لكنه قد يضيف عيوباً إلى الخلفيات. ابدأ بـ0.5 وعدّل بناءً على النتائج.
ADetailer (After Detailer). هذه أكثر أداة تأثيراً لإصلاح الوجوه. يشغّل ADetailer نموذج كشف على الصورة المولّدة، ويحدد الوجوه، ثم يعيد توليدها بدقة أعلى مع مطالبة مخصصة، وكل ذلك تلقائياً. الإعداد المقترح:
- Detection model:
face_yolov8n.pt - Confidence threshold: 0.3
- Denoising strength: 0.22-0.28، أقل من المعتاد لأن المطلوب تحسين الوجه لا استبداله
- Steps: 18-22
- CFG: 4-4.5
- Inpaint only masked: ON
- ADetailer prompt:
natural skin texture, visible pores, subtle imperfections, soft skin transitions, realistic eyes, natural lips
انخفاض قوة إزالة الضوضاء أمر حاسم. عند 0.5+ يستبدل ADetailer الوجه فعلياً، ما قد يضيف عيوباً جديدة أو يفقد هوية الشخصية. أما عند 0.22-0.28 فيحسن التفاصيل الموجودة: يضيف بنية المسام ويزيد حدة العينين ويصحح مشكلات تشريحية طفيفة من دون التخلص من التوليد الأصلي.
تقنيات المطالبات للواقعية. تشكل الكلمات التي تستخدمها الملمس الذي يولده النموذج. ومن محفزات الواقعية الفعالة:
natural skin texture, visible pores, subtle blemishes, frecklescandid iphone camera portrait, raw photo, unretouched85mm portrait lens, shallow depth of field, natural lightingoily skin, sun-damaged skin, aged 35 years old, flyaway hair strands
السطر الأخير غير بديهي لكنه قوي. فالبشر الحقيقيين لديهم بشرة دهنية وأضرار شمسية وبقع عمرية وشعيرات متطايرة. طلب هذه العيوب يدفع النموذج بعيداً عن الوضع المثالي الافتراضي ونحو واقعية فوتوغرافية حقيقية. كما أن تحديد عدسة الكاميرا وإعداد الإضاءة يرسّخ النتيجة في الواقع الفوتوغرافي بدلاً من التصيير الرقمي.
عندما لا يكون الإعداد المحلي خياراً: بدائل سحابية
الحقيقة أن Stable Diffusion محلياً يتطلب عتاداً كبيراً. يحتاج سير عمل SDXL مع LoRA وADetailer وControlNet في الوقت نفسه إلى 12-16 GB من VRAM. ويتطلب سير عمل Flux بالدقة الكاملة 24 GB. لا يملك الجميع هذا المستوى من العتاد أو يرغبون في الاستثمار فيه، كما قد يستغرق الإعداد نفسه، من تثبيت ComfyUI أو AUTOMATIC1111 إلى تنزيل checkpointات متعددة الغيغابايت وضبط samplerات والإضافات، ساعات قبل توليد صورة واحدة.
هنا تقدم أدوات توليد الصور بالذكاء الاصطناعي عبر السحابة بديلاً عملياً. تتيح منصة Seavid AI لتحويل النص إلى صورة الوصول إلى نماذج متقدمة متعددة، منها Seedream 5.0 وNano Banana Pro وGPT Image، عبر واجهة متصفح بلا إعداد محلي. صف رؤيتك في مطالبة نصية، واختر النمط والدقة، ثم ولّد بسرعة. ولمن يحتاج إلى تحسين الصور الموجودة أو تحويلها، تتولى أداة تحويل الصورة إلى صورة نقل النمط والتحسين مع الحفاظ على التكوين، بينما تتيح SeedEdit التحرير بالتعليمات مع الحفاظ على الهوية.
المقابل هو التحكم. يمنحك Stable Diffusion المحلي وصولاً دقيقاً إلى كل معامل: sampler وCFG وعدد الخطوات وأوزان LoRA وnegative prompts وأقنعة inpainting. وتخفي الأدوات السحابية هذه القرارات خلف واجهة أبسط، وهو ما يفيد السرعة وسهولة الوصول لكنه يحدّك إذا احتجت إلى ضبط جوانب محددة من ملمس البشرة أو تفاصيل الوجه. وللنمذجة السريعة أو محتوى الشبكات الاجتماعية أو المستخدمين بلا GPU مخصص، تزيل السحابة حاجز العتاد تماماً. أما للصور الشخصية الواقعية بجودة إنتاجية، حيث لكل مسام أهمية، فما زال سير العمل المحلي متفوقاً.
أخطاء شائعة وكيفية تجنبها
- استخدام نموذج SDXL الأساسي للصور الشخصية. يميل SDXL الأساسي بشكل موثق إلى البشرة البلاستيكية. انتقل دائماً إلى checkpoint واقعي مضبوط مثل RealVisXL أو Juggernaut XL للصور الشخصية.
- تشغيل CFG أعلى من 7 مع البشرة. يكبت CFG المرتفع الملمس الطبيعي. اخفضه إلى 4-6 ودع negative prompt تتولى ضبط الجودة.
- تخطي ADetailer. تفقد الوجوه المولدة عند 1024x1024 التفاصيل عندما يشغل الشخص جزءاً صغيراً من الإطار. يصلح ADetailer ذلك تلقائياً، فلا سبب لتخطيه.
- تكديس عدد كبير من LoRA. تزيد كل LoRA احتمال تغير الألوان وظهور العيوب. ابدأ بـLoRA واقعية واحدة بوزن 0.5، واختبرها، ولا تضف المزيد إلا إذا احتاجت النتيجة.
- نسيان تحديد العيوب. إذا اقتصرت مطالبتك على «امرأة جميلة، بشرة مثالية»، فسيقدم النموذج ذلك تماماً وسيبدو زائفاً. أضف المسام والعيوب وإشارات الإضاءة الطبيعية.
- رفع الدقة دون Hi-Res Fix. يشحذ الرفع القياسي كل شيء بالتساوي، ما قد يجعل البشرة شمعية. استخدم Hi-Res Fix مع قوة إزالة ضوضاء منخفضة تبلغ 0.3-0.4 لتحسين التفاصيل بشكل مضبوط.
الأسئلة الشائعة
هل يمكنني الحصول على نتائج فوتوغرافية واقعية باستخدام SD 1.5، أم أحتاج إلى SDXL؟
نعم. ما زال Realistic Vision V6.0 على SD 1.5 يقدم ألوان بشرة ممتازة وواقعية في الإضاءة. المقابل هو الدقة، 512x512 أصلياً مقابل 1024x1024 في SDXL، واتساق التشريح. إذا كان GPU لديك بذاكرة 4-6 GB، فـSD 1.5 هو خيارك الأفضل، ويمكن رفع دقة النتائج لاحقاً.
ما التغيير الأكثر فاعلية لإصلاح المظهر البلاستيكي؟
أضف negative prompt تستهدفه صراحةً: plastic, smooth skin, airbrushed, poreless, doll-like, flawless. وحده هذا التغيير يحسن النتيجة بوضوح مع معظم checkpointات الواقعية، حتى قبل تعديل sampler أو CFG.
هل أحتاج إلى GPU مخصص، أم يمكنني استخدام الأدوات السحابية؟
يُنصح باستخدام GPU من NVIDIA بذاكرة لا تقل عن 8 GB لسير عمل SDXL المحلي. إن لم يتوفر، تمنح أدوات سحابية مثل Seavid AI الوصول إلى نماذج عالية الجودة عبر المتصفح، مع تحكم أقل في مستوى المعاملات مقارنة بالإعداد المحلي.
أيهما أفضل للواقعية الفوتوغرافية: Stable Diffusion أم Flux؟
ينتج Flux عموماً واقعية فوتوغرافية أعلى مع تشريح والتزام أفضل بالمطالبة، لكنه يحتاج إلى 12+ GB من VRAM حتى بعد التكميم، كما أن منظومة LoRA لديه أصغر. يبقى SDXL الخيار العملي لمعظم المستخدمين بفضل مكتبة النماذج الضخمة والأدوات الناضجة ومتطلبات العتاد الأقل. ولأفضل النتائج على عتاد قوي، يعد Flux Dev بصيغة GGUF Q8 حالياً أفضل خيار محلي.
ما مدى أهمية اختيار sampler لواقعية البشرة؟
أهميته كبيرة. يحافظ DPM++ 2M SDE Karras وDPM++ 3M SDE Karras على الضوضاء عالية التردد التي تتحول إلى ملمس للبشرة. وقد يؤدي الانتقال من Euler a إلى DPM++ SDE Karras إلى تحسن أوضح في واقعية البشرة من تغيير النموذج، خصوصاً مع checkpointات SDXL.



