صفحه اصلی > آکادمی یادگیری > پرامپت‌نویسی کاربردی : مهندسی پرامپت تصویر: راهنمای کامل نوشتن پرامپت حرفه‌ای برای هوش مصنوعی

مهندسی پرامپت تصویر: راهنمای کامل نوشتن پرامپت حرفه‌ای برای هوش مصنوعی

📅 تاریخ انتشار: 1405/05/27 🔄 آخرین بروزرسانی: 1405/06/13
مقدماتی زمان مطالعه: 17 دقیقه
دستانی در حال تایپ پرامپت روی کیبورد، به شش آیکون متصل سوژه، سبک، نور، دوربین، تنظیمات فنی، حس‌وحال که در نهایت به یک پرتره‌ی زن فوتورئال تولیدشده با هوش مصنوعی می‌رسند؛ تجسم بصری فرایند مهندسی پرامپت تصویر

حالا که با ابزارهای ساخت تصویر با هوش مصنوعی آشنا شدی، می‌دونی که تنوع ابزارها چقدر بالاست. اما مهندسی پرامپت برای تصویر، یه تخصص ویژه‌ست که با تسلط بر اون، می‌تونی از پتانسیل کامل این ابزارها بهره‌ببری.

طبق جدیدترین گزارش‌های مالی Adobe که مربوط به سال ۲۰۲۶ است، تعداد کاربران فعال ماهانه‌ی Acrobat و Express از ۷۰۰ میلیون نفر سال قبل به بیش از ۸۵۰ میلیون نفر در سال ۲۰۲۶ رسیده، درآمد عودت‌شونده‌ی سالانه (ARR) Firefly به نزدیک ۳۰۰ میلیون دلار رسیده و درآمد کلی مرتبط با هوش مصنوعی Adobe از مرز ۵۰۰ میلیون دلار عبور کرده. این ارقام رشد سرسام‌آور تولید تصویر با هوش مصنوعی رو به‌خوبی نشون میدن. [1]

آمار رشد بازار پرامپت‌نویسی تصویر با هوش مصنوعی؛ درآمد Adobe Firefly و تحلیل دیتاست DiffusionDB

در کنار این، تحلیل‌های انجام‌شده روی مجموعه‌داده‌ی DiffusionDB الگوهای موفق پرامپت‌نویسی رو شناسایی کرده. زیرمجموعه‌ی DiffusionDB 2M شامل ۲ میلیون تصویر و ۱.۵ میلیون پرامپت منحصربه‌فرد است. [2]

منابعی مثل دایرکتوری awesome-generative-ai هم کلی ابزار و تکنیک در اختیارت می‌ذارن. توی این راهنما، اصولی رو یاد می‌گیری که خروجی‌هات رو به اون چیزی که توی ذهن داری، نزدیک‌تر کنه.


خلاصه سریع:

  1. ۷ مؤلفه اصلی یک پرامپت تصویری حرفه‌ای: موضوع، سبک، نور، زاویه، جزئیات فنی، حس‌وحال و در صورت نیاز پرامپت منفی.
  2. از فرمول فوتورئال گوگل برای واقع‌گرایی استفاده کنید.
  3. به وزن‌دهی موقعیتی کلمات توجه کنید.
  4. از کلیدواژه‌های مرده مثل masterpiece یا 8k پرهیز کنید.


پرامپت تصویری چه فرقی با پرامپت متنی داره؟

پرامپت متنی معمولاً یک دستور یا سؤال مستقیم است؛ مثلاً «خلاصه‌ای از این مقاله بنویس» یا «چند ایده برای سئو پیشنهاد بده». در مقابل، پرامپت تصویری باید یک توصیف کامل از صحنه باشد که جزئیاتی مثل نور، زاویه‌ی دوربین، سبک هنری، رنگ‌بندی و ترکیب‌بندی را دربربگیرد.

گوگل در راهنمای Gemini 2.5 Flash می‌گوید: «صحنه را توصیف کن، نه اینکه فقط کلیدواژه‌ها را فهرست کنی». از طرفی، مستندات Midjourney تأکید دارد که «پرامپت‌های کوتاه و ساده معمولاً بهترین تصاویر را تولید می‌کنند». این دو اصل که مکمل هم هستند توصیف غنی و مختصر بودن نقطه‌ی شروع مهندسی پرامپت تصویری است. [3] [4]


پرامپت تصویری خوب از چه اجزایی تشکیل شده؟

یک پرامپت تصویری حرفه‌ای از 7 جزء کلیدی تشکیل شده که هرکدوم نقش مهمی در شکل‌دهی به خروجی نهایی دارن. بیا با مثال‌های عملی ببینیمشون تا وقتی پرامپت عکس می‌نویسی، هیچ نکته‌ای رو از قلم نندازی:

اینفوگرافیک شش مؤلفه کلیدی مهندسی پرامپت تصویر شامل موضوع، سبک، نور، زاویه دوربین، جزئیات فنی و حس‌وحال

۱. موضوع اصلی (سوژه)

اول مشخص کن که کی یا چی قراره توی مرکز تصویر باشه. هرچی شفاف‌تر توصیف کنی، خروجی مرتبط‌تری می‌گیری.


۲. سبک و مدیوم

بگو که می‌خوای خروجی عکس واقعی باشه، نقاشی، طرح سه‌بعدی، یا هر سبک دیگه. این جزء، هویت بصری اثر رو تعیین می‌کنه.


۳. نورپردازی و رنگ

نور، روح تصویر محسوب میشه. نوع نور (طبیعی، مصنوعی، پشت‌نور) و پالت رنگی (گرم، سرد، تک‌رنگ) رو مشخص کن تا عمق و احساس به تصویر منتقل بشه.


۴. زاویه‌ی دوربین و کادربندی

بگو از چه زاویه‌ای به سوژه نگاه کنیم (روبرو، از بالا، پایین‌نما) و کادربندی چطور باشه (نماهای بسته، متوسط یا باز). این قسمت ترکیب‌بندی (Composition) رو کنترل می‌کنه.


۵. جزئیات فنی (کیفیت و نسبت ابعاد)

توی این بخش، مشخصات فنی مثل کیفیت رندرینگ و نسبت ابعاد (نسبت عرض به ارتفاع) رو تعیین می‌کنی. انتخاب درست نسبت ابعاد مثل ۱۶:۹ برای صحنه‌های سینمایی یا ۱:۱ برای پست‌های شبکه‌های اجتماعی، تأثیر مستقیمی روی ترکیب‌بندی نهایی داره.


۶. حس‌وحال (اتمسفر)

فضای احساسی تصویر رو توصیف کن تا بیننده باهاش ارتباط عاطفی برقرار کنه. این جزء، تفاوت بین یه تصویر خشک و یه اثر موندگار رو رقم می‌زنه.

مثال: «فضایی نوستالژیک، آرام و غم‌اندیش که یادآور عصرهای پاییزی‌ست»


۷. کلمه‌ی اول پرامپت مهم‌تر از کلمه‌ی آخر است

مدل‌های Midjourney (نسل V7 به بعد) به توکن‌های ابتدای پرامپت وزن بیشتری می‌دن. [5] یعنی اگه سوژه‌ی اصلی رو اول جمله نیاری و به‌جاش با توصیف سبک یا حس‌وحال شروع کنی، مدل ممکنه روی همون کلمات اولیه تمرکز بیش‌ازحد کنه و سوژه رو کم‌رنگ‌تر از چیزی که مدنظرته دربیاره.

قانون عملی: همیشه سوژه رو اول بیار، بعد جزئیات بصری، بعد محیط، و در آخر رفرنس سبک و پارامترها. [6]

با ترکیب این هفت مؤلفه، یه پرامپت می‌نویسی که تمام ابعاد توصیفی مدنظر Midjourney (شامل Subject, Medium, Environment, Lighting, Color, Mood, Composition, Eraly Tokens) رو پوشش میده و هوش مصنوعی رو کامل با خواسته‌ی تو هم‌جهت می‌کنه.


چطور با فرمول گوگل پرامپت فوتورئال بنویسیم؟

در راهنمای رسمی گوگل برای مدل Gemini 2.5 Flash، یک قالب استاندارد و قدرتمند برای نوشتن پرامپت‌های فوتورئال ارائه شده. این فرمول که حاصل سال‌ها تحقیق روی مدل‌های زبانی-بصری است، بهت کمک می‌کند تا توصیفی دقیق و منسجم از صحنه بدی.

توصیفی که هوش مصنوعی را به سمت خلق تصویری واقع‌گرایانه و هماهنگ با تمام جزئیات دلخواهت هدایت کند. گوگل تأکید داره که یک پاراگراف روایی توصیفی همیشه نتیجه‌ای بهتر و منسجم‌تر از لیستی از واژه‌های بی‌ربط تولید می‌کند. [7]

قالب رسمی‌شون اینه:


«A photorealistic [نمای] of [موضوع، عمل یا حالت] set in [محیط]. The scene is illuminated by [توصیف نورپردازی] creating a [حس‌وحال] atmosphere. Captured with a [جزئیات دوربین و لنز] emphasizing [بافت‌ها و جزئیات کلیدی] The image should be in a [نسبت ابعاد] format.»


برای اطلاعات بیشتر می‌توانی راهنمای رسمی گوگل برای پرامپت‌نویسی را مطالعه کنی. حالا بیا این فرمول رو با یه مثال عینی توی فارسی پیاده کنیم:


مثال پرامپت فوتورئال با قالب گوگل:

«یک نمای فوتورئال نزدیک (کلوزآپ) از زن جوانی که چای داغ را از قوری بلوری در فنجان سفید لعابی می‌ریزد، با لبخندی آروم و متمرکز، توی کافه‌ای سنتی با کف‌پوش‌های چوبی و قفسه‌های قدیمی. صحنه با نور گرم و ملایم لوسترهای آویزان روشن شده و فضایی دلنشین، صمیمی ایجاد می‌کنه. تصویر با لنز ۵۰ میلی‌متری با دیافراگم f/1.8 ثبت شده و بر بافت بخار چای و انعکاس نور روی لعاب فنجان تأکید داره. تصویر باید در فرمت نسبت ابعاد ۳:۲ باشه.»


۳ مثال Before/After

حالا سه سناریوی متفاوت (پرتره، محصول، منظره) رو با هم مقایسه می‌کنیم تا ببینیم دقیق‌نویسی چقدر توی کیفیت خروجی تأثیر داره. هر بخش، پرامپت ساده (Before) رو کنار پرامپت دقیق (After) قرار میده که بر اساس اصول و فرمول‌های همین راهنما نوشته شده.


۱. سناریوی پرتره

Before (پرامپت ساده): «یک مرد مسن»

مقایسه قبل و بعد پرامپت‌نویسی پرتره مرد مسن با نورپردازی دراماتیک، تولیدشده با Midjourney V7

After (پرامپت دقیق):

«پرتره فوتورئال از نمای نزدیک (کلوزآپ) یک مرد مسن ۷۰ ساله با ریش جوگندمی پرپشت و چین‌وچروهای عمیق دور چشم، با نگاهی خیره و در عین حال آرام. نور ملایم و دراماتیک رامبراند از پنجره‌ی سمت چپ، سایه‌ای مشخص روی گونه‌ی راست ایجاد کرده است. پس‌زمینه دیوار آجری تیره با بافت خشن. ثبت شده با لنز ۸۵ میلی‌متری f/1.4، بر روی بافت پوست و رشته‌های ریش تأکید دارد. تصویر باید در فرمت نسبت ابعاد ۲:۳ باشد.»
  1. ابزار و نسخه: Midjourney V7، نسبت ابعاد: ۲:۳، برچسب: تست شده، تولید شده توسط: عرفان سیف‌جهانی، Jaryan AI

چرا این انتخاب‌ها کار کرد؟

نور رامبراند تصادفی انتخاب نشده. این تکنیک با ساختن یه مثلث نور کوچیک زیر چشمِ سمت تاریک‌تر صورت شناخته می‌شه، الگویی که ناخودآگاه "عمق و شخصیت" رو به بیننده منتقل می‌کنه. برای صورتی با چین‌وچروک عمیق، این دقیقاً همون چیزیه که لازمه: نور تخت چروک‌ها رو محو می‌کنه، نور رامبراند برجسته‌شون می‌کنه.


دیافراگم f/1.4 هم با همین منطق انتخاب شده. عمق میدان اینقدر کمه که فقط چشم‌ها تیز می‌مونن؛ بقیه‌ی صورت و پس‌زمینه به‌آرومی محو می‌شه. نتیجه؟ نگاه بیننده بدون هیچ دستور صریحی، مستقیم می‌ره سمت چشم‌ها.


۲. سناریوی محصول

Before (پرامپت ساده): «یک بطری عطر»

مقایسه قبل و بعد پرامپت‌نویسی عکاسی محصول بطری عطر، تولیدشده با ChatGPT Images 2

After (پرامپت دقیق):

«نمای ماکرو فوتورئال از یه بطری عطر شیشه‌ای مستطیلی با شیشه‌ی سکوریت مات و درپوش طلایی براق، با قطرات ریز آب و بخار روی سطح سرد شیشه. نور استودیویی با کلید نور بالا از پشت و چراغ‌های جانبی نرم، انعکاس‌های سفید خالص روی لبه‌های شیشه ایجاد کرده. زمینه سطح مرمری سفید و صاف. ثبت شده با لنز ۱۰۰ میلی‌متری ماکرو، بر روی بافت شیشه‌ی مات و قطرات میعان تأکید داره. تصویر باید در فرمت نسبت ابعاد ۱:۱ باشه.»
  1. ابزار و نسخه: ChatGPT Images 2.0، نسبت ابعاد: ۱:۱، برچسب: تست شده، تولید شده توسط: عرفان سیف‌جهانی، Jaryan AI


چرا این انتخاب‌ها کار کرد؟

نور از پشت (Backlight) برای شیشه یه دلیل فیزیکی ساده داره: نور باید از داخل جسم شفاف رد بشه تا لبه‌ها به‌جای انعکاس مبهم، خطوط نورانی و تمیز نشون بدن. استودیوهای عکاسی محصول به این می‌گن Rim Light. اگه از جلو نور می‌تابوندیم، شیشه فقط محیط اطراف رو منعکس می‌کرد، نه خودش رو.


لنز ماکرو ۱۰۰ میلی‌متری هم انتخاب استانداردِ عکاسی محصول لوکسه، چون اعوجاج پرسپکتیو نزدیک به صفره. یعنی خطوط مستقیم بطری، مستقیم می‌مونن. خیلی از پرامپت‌های آماتوری همین یه نکته رو نادیده می‌گیرن و نتیجه‌شون یه بطری با فرم دگرگون‌شده می‌شه.


۳. سناریوی منظره

Before (پرامپت ساده): «یک جنگل»

مقایسه قبل و بعد پرامپت‌نویسی برای منظره جنگل با نور خورشید، تولیدشده با Stable Diffusion 3.5

After (پرامپت دقیق):

«چشم‌انداز فوتورئال وسیع از جنگل انبوه کاج‌های سرو و نراد در اوایل پاییز، با مه غلیظ صبحگاهی که بین تنه‌های عمودی درختان پیچیده. پرتوهای طلایی خورشید (نور حجمی) از میان شاخه‌های بلند نفوذ کرده و لایه‌های مه رو روشن می‌کنه. کف جنگل پوشیده از خزه و برگ‌های کاج خشکیده. ثبت شده با لنز واید ۱۶-۳۵ میلی‌متری در دیافراگم f/8، بر روی وضوح بی‌نهایت و بافت خزه‌ها تأکید داره. تصویر باید در فرمت نسبت ابعاد ۱۶:۹ باشه.»
  1. ابزار و نسخه : Stable Diffusion 3.5، نسبت ابعاد: ۱۶:۹، برچسب: تست شده، تولید شده توسط: عرفان سیف‌جهانی، Jaryan AI


چرا این انتخاب‌ها کار کرد؟

نور حجمی (God Rays) فقط وقتی در طبیعت شکل می‌گیره که ذرات معلق — مه، گردوغبار — نور رو پراکنده کنن. برای همین «مه صبحگاهی» قبل از نور حجمی اومده؛ این دو از نظر فیزیکی به هم وابسته‌ان. بدون مه، مدل احتمالاً یا نور رو مسطح رندر می‌کنه، یا اصلاً حذفش می‌کنه.


دیافراگم f/8 هم انتخاب کلاسیک منظره‌ست. برخلاف پرتره که عمق میدان کم می‌خواستیم، اینجا باید همه‌چیز از جلو تا افق تیز بمونه. f/8 همون Sweet Spot بیشتر لنزهاست: عمق میدان کافی، بدون افت کیفیت ناشی از پراش نور (Diffraction) که در دیافراگم‌های خیلی بسته‌تر شروع می‌شه.


چطور پرامپت را مرحله‌به‌مرحله اصلاح کنیم؟

بزرگ‌ترین اشتباه پرامپت‌نویسان تازه‌کار، نوشتن یک پرامپت طولانی و کامل در همون قدم اوله. این روش دو مشکل داره: اول اینکه اگه نتیجه بد باشه، نمی‌دونی کدوم بخش از پرامپت مقصره؛ دوم اینکه معمولاً باعث می‌شه جزئیات زیادی رو حدسی و بدون تست اضافه کنی.

روش حرفه‌ای، نگارش پلکانی است — یعنی شروع با یک پرامپت کوتاه، دیدن خروجی، و افزودن یک لایه‌ی جزئیات در هر مرحله.

مرحله پرامپت چه چیزی اضافه شد؟ چرا این ترتیب؟
1 یک مرد مسن فقط سوژه ببین مدل بدون هیچ راهنمایی چی می‌سازه
2 ۷۰ ساله با ریش جوگندمی جزئیات ظاهری سوژه مشخص کردن هویت بصری قبل از هر چیز دیگه، چون سوژه اولویت اول موقعیتیه
3 نور ملایم رامبراند از پنجره‌ی سمت چپ نورپردازی حالا که سوژه ثابت شده، نور رو اضافه کن تا ببینی چطور حس صحنه رو عوض می‌کنه
4 لنز ۸۵ میلی‌متری f/1.4 جزئیات فنی دوربین جزئیات فنی رو آخر اضافه کن، چون این‌ها ظرافت‌های نهایی‌ان، نه ستون اصلی صحنه

نکته‌کلیدی: بعد از هر مرحله، خروجی رو نگاه کن و بپرس: این لایه‌ی جدید واقعاً چیزی که می‌خواستم رو اضافه کرد؟

اگه نه، همون لایه رو بازنویسی کن، نه کل پرامپت رو. این روش هم وقتت رو کمتر تلف می‌کنه، هم بهت یاد می‌ده هر جزء چه تأثیری روی خروجی داره، دقیقاً همون شهودی که برای نوشتن پرامپت‌های پیچیده‌تر بعداً لازم داری.


چه کلمه‌هایی در پرامپت‌نویسی تصویر دیگه اثر ندارن؟

دلیل اصلی اینکه برخی از کلمات کلیدی دیگر مؤثر نیستند، تغییرات در رمزگذار مدل است. مدل‌های قدیمی‌تر، مانند Diffusion Stable 1.5، به شدت به توکن‌های کیفی (مانند master) متکی بودند؛ با این حال، مدل‌های جدیدتر، مانند Flux و Gemini 3.1، با استفاده از معماری T5 و CLIP چندوجهی، دیگر این برچسب‌های انتزاعی را درک نمی‌کنند زیرا میلیون‌ها تصویر واقعی را بدون چنین برچسب‌هایی در داده‌های آموزشی خود دیده‌اند. در واقع، «توکن‌های مرده» کلماتی هستند که مدل برای آنها وزنی تعیین نمی‌کند و آنها را به عنوان نویز دور می‌ریزد. [8]

در ادامه، مهم‌ترین‌شان را باهم بررسی می‌کنیم:

واژه یا عبارت دلیل بی‌اثری
masterpiece واژه‌ای انتزاعی و کلی است و مدل را به سمت خاصی هدایت نمی‌کند
4k, HD,8k برچسب‌های فنی بدون توصیف محتوای صحنه هستند
trending on ArtStation کلیدواژه‌ای خشک بدون اطلاعات سوژه یا نور است
cinematic, epic صفت‌های مبهم و کلی که تأثیر واقعی ندارند
ultra realistic صفت کلی و بیش‌ازحد استفاده‌شده که دیگر تأثیر خاصی ندارد
in the style of مدل‌های جدید به جای این عبارت، از تصاویر مرجع بهتر استقبال می‌کنند
hyperdetailed واژه‌ای مبهم و بدون معیار مشخص
digital art برچسب بسیار کلی که سبک خاصی را منتقل نمی‌کند
  1. گردآوری شده توسط عرفان سیف‌جهانی، تحریریه JaryanAI، مرداد ۱۴۰۵.


دستور زبان هر مدل تولید تصویر چه فرقی با بقیه داره؟

در دنیای حرفه‌ای امروز، دستور زبان مدل‌ها را در سه پارادایم اصلی خلاصه می‌کنیم:

جدول دستور زبان اختصاصی پرامپت‌نویسی تصویر در Stable Diffusion، Midjourney، ChatGPT Images، Flux و Gemini

1.1 دستور زبان عددی یا وزنی (Weighted / Numeric Syntax):

این روش مخصوص نسخه‌های اولیه‌ی Stable Diffusion و برخی مدل‌های فاین‌تیون‌شده‌ی متن‌باز است. در این مدل‌ها، شما با پرانتز و کروشه به مدل می‌گفتید که روی چه کلماتی بیشتر تمرکز کند. مثال: (جزئیات صورت:1.3) یعنی اهمیت صورت را ۳۰ درصد بیشتر کن، یا [سایه‌ها:0.7] یعنی سایه‌ها کمرنگ‌تر شوند. مدل‌های نسل جدید مثل Flux و Gemini 3.1، این اعداد و پرانتزها را به‌عنوان کاراکترهای اضافی (Noise) شناسایی کرده و کاملاً نادیده می‌گیرند؛ پس اگر با ابزارهای مدرن کار می‌کنید، این پارادایم منسوخ شده است.


1.2 دستور زبان ترکیبی (Hybrid Syntax):

این پارادایم، استاندارد طلایی امروز برای ابزارهایی مثل Midjourney و Images in ChatGPT است. در اینجا، پرامپت از دو بخش مجزا تشکیل می‌شود:


  1. بخش اول: یک جمله‌ی طبیعی و روان که صحنه، سوژه، نور و حس‌وحال را توصیف می‌کند.
  2. بخش دوم: پارامترهای خط فرمان که پشت سر جمله می‌آیند و کارِ فنی را انجام می‌دهند؛ مثل نسبت ابعاد (--ar 16:9)، استایل (--style raw)، خلاقیت (--s 250).


قانون این پارادایم: هیچ‌گاه پارامترهای فنی را داخل جمله‌ی اصلی قاطی نکنید. مدل، بین «جمله» و «دستورات خط فرمان» تمایز قائل می‌شود و در صورت ادغام، هر دو بخش را خراب می‌کند.

1.3 دستور زبان ویرایشی و گفتگویی (Conversational / Editorial Syntax):

این پارادایم مختص جدیدترین نسل از مدل‌ها، به‌ویژه Gemini 3.1 Flash Image (Nano Banana2) است. این مدل‌ها دیگر «توصیف‌کننده» نیستند؛ بلکه «ویرایشگر» هستند. شما نباید صرفاً بگویید چه صحنه‌ای می‌خواهید، بلکه باید به‌عنوان یک کارگردان، دستور تغییر بدهید. یک پرامپت استاندارد در این پارادایم سه مؤلفه دارد:


  1. اقدام یا تغییر (چه چیزی را عوض کنم؟)
  2. ارجاع به مرجع (این تغییر را روی کدام بخش یا تصویر اعمال کنم؟)
  3. ثبات و حفظ‌کردن (چه چیزهایی را دقیقاً به‌همان شکل نگه دارم؟)


مثال: «چهره‌ی سوژه را به لبخند تغییر بده، ولی نورِ طلایی پس‌زمینه و بافتِ کتِ چرمی را دقیقاً همین‌طور حفظ کن.» این مدل‌ها توصیفاتِ ایستا را نمی‌پسندند و بهترین خروجی را زمانی می‌دهند که شما با آنها وارد «گفتگو» شوید.


پرامپت منفی چیست و چطور جلوی خروجی‌های ناخواسته را بگیریم؟

پرامپت منفی به مدل می‌گه چه چیزی نباید توی تصویر باشه — برخلاف پرامپت اصلی که می‌گه چی باشه. این تکنیک توی Stable Diffusion یه فیلد کاملاً جدا و اجباریه، توی Midjourney با پارامتر --no اعمال می‌شه، ولی Flux اصلاً ازش پشتیبانی نمی‌کنه — چون معماری T5 این مدل به‌جای فیلتر کردن کلمات منفی، کل صحنه رو مستقیم از توصیف مثبت می‌سازه.


مثال کاربردی (روی همون سناریوی پرتره‌ی بالا):

اگه توی Stable Diffusion همون پرامپت پرتره رو بزنی و خروجی دست‌های اضافه یا انگشت‌های بدشکل بده، پرامپت منفی زیر رو اضافه کن:

deformed hands, extra fingers, blurry, low quality, distorted face, asymmetrical eyes

این یه لیست استاندارد صنعتیه که تقریباً همیشه توی عکاسی پرتره با Stable Diffusion استفاده می‌شه، چون این مدل بیشتر از بقیه توی رندر دست و صورت مشکل داره.


قانون عملی: پرامپت منفی رو فقط وقتی اضافه کن که یه مشکل مشخص توی خروجی دیدی — نه از اول، چون پرامپت منفی طولانی و کلی (مثل نوشتن ۲۰ تا کلمه‌ی نامرتبط) دقیقاً همون مشکل «توکن‌های بی‌اثر» رو ایجاد می‌کنه که بالاتر توی همین مقاله بهش اشاره کردیم.


واژه‌نامه‌ی کوتاه اصطلاحات

  1. نسبت ابعاد (Aspect Ratio): نسبت پهنا به ارتفاع تصویر که فرمت نهایی رو تعیین می‌کنه؛ مثلاً ۱۶:۹ برای صحنه‌های سینمایی و منظره، و ۲:۳ برای پرتره‌های عمودی.
  2. سبک مرجع (Style Reference): تصویری که به‌عنوان الگوی بصری به مدل داده میشه تا سبک، رنگ‌بندی یا ترکیب‌بندی‌اش رو توی خروجی جدید تقلید کنه؛ این تکنیک توی مدل‌هایی مثل Midjourney خیلی رایجه.
  3. بذر تصادفی (Seed): عددیه که نقطه‌ی شروع تصادفی‌سازی مدل رو تعیین می‌کنه. اگه پرامپت و Seed یکسان بمونن؛ این تکنیک برای وقتی مفیده که می‌خوای فقط یه بخش کوچیک از پرامپت رو تغییر بدی و بقیه‌ی ترکیب‌بندی ثابت بمونه، بدون اینکه کل تصویر از نو و تصادفی ساخته بشه.
  4. مرجع شخصیت (Character Reference / --cref): یکی از ترندهای تازه‌ی ۲۰۲۶ توی Midjourney؛ برخلاف مرجع سبک که فقط ظاهر بصری رو کپی می‌کنه، این پارامتر هویت یه شخصیت مشخص (چهره، فرم بدن) رو از یه عکس مرجع می‌گیره و توی صحنه‌های جدید نگه می‌داره — کاربرد اصلیش برای وقتیه که می‌خوای یه شخصیت ثابت رو توی چند تصویر مختلف (مثلاً برای کمپین تبلیغاتی) تکرار کنی.


پرسش‌های متداول (FAQ)


۱. آیا می‌توانم از تصاویر تولیدشده با هوش مصنوعی برای اهداف تجاری استفاده کنم؟

پاسخ: بستگی به سیاست‌های هر ابزار داره؛ مثلاً Adobe Firefly و Midjourney برای کاربران پولی، حقوق تجاری تصاویر تولیدشده رو به‌طور کامل واگذار می‌کنن. اما در نسخه‌های رایگان یا بعضی مدل‌های متن‌باز مثل Stable Diffusion، ممکنه محدودیت‌هایی وجود داشته باشه. همیشه قبل از استفاده‌ی تجاری، صفحه‌ی شرایط استفاده (Terms of Service) ابزار موردنظر رو به‌دقت مطالعه کن. همچنین اگه پرامپت شما شامل اسم برندها، شخصیت‌های معروف یا آثار دارای کپی‌رایت باشه، خروجی ممکنه مشمول قوانین مالکیت معنوی بشه...اگه هنوز مطمئن نیستی کدوم ابزار برای این تکنیک‌ها مناسب‌تره، راهنمای انتخاب بهترین ابزار تولید تصویر رو یه نگاه بنداز.


۲. آیا پرامپت‌های طولانی همیشه نتیجه‌ی بهتری دارن؟

پاسخ: نه، لزوماً. همون‌طور که توی راهنمای Midjourney تأکید شده، پرامپت‌های کوتاه و ساده معمولاً بهترین تصاویر رو تولید می‌کنن. اما گوگل برای مدل Gemini توصیه می‌کنه که یه «پاراگراف روایی توصیفی» بنویسی، نه لیستی از کلیدواژه‌ها. برگه تقلب شما اینه که: پرامپت باید به اندازه‌ای دقیق باشه که تمام شش مؤلفه‌ی اصلی (موضوع، سبک، نور، زاویه، جزئیات فنی و حس‌وحال) رو پوشش بده، اما بدون زیاده‌گویی و تکرار. پرامپت‌های خیلی بلند (بیش از ۲۰۰ کلمه) اغلب مدل رو سردرگم می‌کنن.


۳. تفاوت نسخه‌های مختلف Midjourney چیه و کدوم رو انتخاب کنم؟

پاسخ: طبق مستندات رسمی Midjourney، مدل پیش‌فرض فعلی V8.2 است که در ۲۴ ژوئیه ۲۰۲۶ جایگزین V8.1 شد و روی زیبایی‌شناسی، کیفیت تصویر و شخصی‌سازی خروجی تمرکز داره — نه لزوماً روی سرعت یا قابلیت‌های بنیادی جدید (چون از نظر معماری همون V8.1 هست، فقط تیونینگ متفاوت داره). نسخه‌ی V8 (که در نسخه‌ی آلفا از مارس ۲۰۲۶ عرضه شد) نسبت به V7 سرعت تولید رو حدود ۵ برابر افزایش داده و به‌صورت پیش‌فرض تصاویر ۲K تولید می‌کنه. اگه به دنبال واقع‌گرایی و کیفیت بالاتر هستی، از V8.2 استفاده کن؛ V7 و نسخه‌های قدیمی‌تر هنوز قابل انتخابن ولی از نظر جزئیات و رندرینگ متن، عقب‌ترن.


۴. چطور از سوگیری (Bias) در تصاویر تولیدشده جلوگیری کنم؟

پاسخ: مدل‌های هوش مصنوعی بر اساس داده‌های عظیم اینترنتی آموزش دیدن که ممکنه حاوی سوگیری‌های جنسیتی، نژادی یا فرهنگی باشن. برای کاهش این سوگیری‌ها: توی پرامپت خودت از توصیفات خنثی استفاده کن (مثلاً به‌جای «پرستار زن» بگو «پرستار»). چنانچه خروجی حاوی سوگیری بود، اون رو با پرامپت‌های اصلاحی مثل «تصویری متعادل و همه‌شمول» یا «با تنوع قومیتی» بازنویسی کن.

5. چگونه از تولید تصاویر جعلی یا دیپ‌فیک با هوش مصنوعی جلوگیری کنیم؟

پاسخ: ابزارهای معتبر مثل Adobe Firefly و Midjourney دارای سیستم‌های تشخیص محتوای مضر هستند و در تصاویر خروجی، ردپای دیجیتال (Watermark) یا متادیتا قرار می‌دهند. همچنین در پرامپت خود از تولید محتوای توهین‌آمیز، جعلی یا نقض‌کننده‌ی حریم خصوصی اجتناب کنید. همواره از ابزارهای دارای گواهی اخلاقی (Ethical AI) استفاده کنید.


سخن پایانی

مهندسی پرامپت تصویری در اصل یعنی توصیف ساختاریافته و منسجم صحنه، نه پرتاب کلیدواژه‌های بی‌ربط به سمت مدل. با به‌کارگیری اصولی که در این راهنما مرور کردیم؛ از فرمول فوتورئال گوگل گرفته تا شناخت توکن‌های مرده و دستور زبان هر مدل. حالا می‌تونی خروجی‌های هوش مصنوعی را تا حد قابل‌توجهی به تصویر ذهنی‌ات نزدیک کنی.

حالا نوبت شماست: یک با تکنیک‌های این راهنما پرامپت بنویس، اون رو به سطح بالاتری ببر. نتیجه رو با ما در بخش نظرات به اشتراک بگذار!


برچسب ها :
مهندسی پرامپت پرامپت‌نویسی تصویری Midjourney
عرفان سیف جهانی
سلام! من عرفان هستم و در جریان AI به‌عنوان مجری محتوا و استراتژیست سئو فعالیت می‌کنم. محتوا رو جوری می چینم که پیدا کردنش در وب برای شما راحت باشه. اینجا می‌نویسم تا دنیای هوش مصنوعی رو ساده‌تر و قابل‌فهم‌تر کنیم برای همه‌ی فارسی‌زبون‌هایی که می‌خوان با این ابزارها آشنا بشن و ازشون درست استفاده کنن.
بیشتر بخوانید ...
تولید تصویر با هوش مصنوعی: راهنمای انتخاب بهترین ابزار (۲۰۲۶) ابزارهای توسعه

تولید تصویر با هوش مصنوعی: راهنمای انتخاب بهترین ابزار (۲۰۲۶)

یک گربه‌ی نارنجی، دو پرامپت، دو دنیای متفاوت. ببینید یک جمله‌ی دقیق‌تر چطور خروجی هوش مصنوعی را از یک عکس ساده به یک اثر سینمایی تبدیل می‌کند — و کدام ابزار برای شما رایگان و بی‌دردسر است.

138 بازدید

دیدگاهتان را بنویسید

جریان AI
برچسب ها
  • هوش مصنوعی
  • یادگیری ماشین
  • Claude Code
  • ابزارهای توسعه
  • یادگیری عمیق
  • مهندسی پرامپت
  • chatgpt
  • DeepSeek
  • Stable Diffusion
  • FLUX