GPT-Image-2 پرامپت را تحتاللفظی میخواند، پس روش پرامپتنویسی برایش نام بردن چیزهاست، نه سربسته حرف زدن دربارهٔ آنها: موضوع، کاری که میکند، نور، کادربندی، و کلمات دقیقی که میخواهید داخل تصویر چاپ شوند. در منوی مدلهای بات ما انتخابش کنید و یک پیام بنویسید که همه اینها را بگوید. هرچه ننویسید، مدل خودش پرش میکند، و همین تنها دلیلی است که بیشتر تلاشهای اول شبیه ایده یک نفر دیگر برمیگردند.
فرمول پرامپت GPT-Image-2
شش بخش تقریباً هر پرامپتی را پوشش میدهند: موضوع، کنش، محیط، نور و لنز، کادربندی، سبک. به همین ترتیب و با جملههای ساده بنویسیدشان:
A cream colored A3 poster taped by its four corners to a weathered wooden wall, warm side light from the left, shot straight on, the poster reads “FRESH BREW” in bold black letters with a smaller line under it reading “2 FOR 1 UNTIL FRIDAY”, with an illustrated latte cup below the text
موضوع همان یک چیزی است که تصویر درباره آن است: یک اسم با دو سه صفت، نه یک دستهبندی کلی. کنش کاری است که همین حالا دارد انجام میدهد، و همین است که نمیگذارد یک پرتره شبیه عکس پاسپورتی شود. محیط آن را جایی مینشاند و لوازم صحنه را با خود میآورد: دیوار چوبی و چسب کاملاً متفاوت از قاب یک گالری خوانده میشوند.
نور و لنز بیشترِ کار بصری را انجام میدهد: نور گرم از پهلو، روشنایی روز ابری، یک چراغ سخت، لنز واید 35 میلیمتری، پرتره 85 میلیمتری با عمق میدان کم. GPT-Image-2 اینها را عیناً اعمال میکند و آنها را در یک سبک ثابت و همیشگیِ خودش میانگین نمیگیرد. کادربندی نما را تعیین میکند، کلوزآپ، تا کمر، یا باز، بهعلاوه زاویه دوربین. سبک پرامپت را میبندد: فوتورئالیستیک، ادیتوریال، تصویرسازی فلت، رندر سهبعدی.
تحتاللفظی بودن دو لبه دارد، و دقیقاً به همین دلیل این فرمول اینجا زودتر از هر جای دیگری جواب میدهد. مدل برای پوشاندن یک پرامپت مبهم اتمسفر از خودش نمیسازد، و یک دستور عجیب را هم بیسروصدا کنار نمیگذارد. یک بخش اضافه کنید، همان بخش را در رندر بعدی میبینید.
دو پوستر پایین همین صفحه یک ایده هستند که دو بار اجرا شده. اولی از یک خط آمده، “a poster about a coffee sale”، و مدل متن خودش را نوشته: یک تیتر، یک نام برند، یک تخفیف و یک تاریخ پایان، که هیچکدام خواسته نشده بودند. دومی متن دقیق، سطح و نور را نام میبرد. نام بردن کلمات همان کاری است که کلمات شما را بهجای کلمات مدل داخل تصویر میگذارد.
پیوست کردن عکس: @image1 و @image2
برای ویرایش، تا 4 عکس را در یک پیام بفرستید و دستور را بهعنوان توضیح همان پیام بنویسید. عکس در یک پیام و متن در پیام بعدی دو پیام جداگانهاند و با هم جفت نمیشوند. راهنمای قدمبهقدم این قانون یکپیامی را کامل توضیح میدهد.
وقتی چند عکس پیوست شد، با شماره خطابشان کنید. GPT-Image-2 این ارجاعها را دقیق دنبال میکند و همین آن را به متخصص ویرایش تبدیل کرده است:
Put the face from @image1 onto the person in @image2, keep the hairstyle and the jacket from @image2 unchanged, match the skin tone to @image1, studio light, waist up
آنچه را باید حفظ شود به همان صراحتِ آنچه باید تغییر کند بنویسید. “Keep the background unchanged” و “do not alter the pose” دستورهایی هستند که مدل واقعاً اجرا میکند، و بدون آنها یک ویرایش بخش بیشتری از کادر را از نو میکشد. شمارهها را حذف کنید و مدل خودش تصمیم میگیرد کدام مرجع برای چیست.
GPT-Image-2 کجا قوی است و کجا نیست
| قوی در | ضعیف در |
|---|---|
| متن خوانا داخل تصویر | پاراگرافهای طولانی متن |
| ویرایش عکس از روی پیوستهای خودتان | نداشتن نسبت فوقعریض 21:9؛ در بات فقط Seedream آن را دارد |
| دنبال کردن دستورهای تحتاللفظی و چندبخشی | پرامپتهای یکخطی، شاعرانه و رها |
| عکس محصول، تابلو، پوستر، بستهبندی | هر چیزی که فیلتر سختگیرش علامت بزند |
| تکرار ارزان با 1 اعتبار برای تصویر 1K | تصویرسازی بهشدت سبکدار و کارهای نقاشانه |
برای هنر سبکدار از Seedream شروع کنید، و برای حداکثر کیفیت روی یک صحنه پیچیده از NanoBanana Pro.
درست درآوردن متن داخل تصویر
متن همان دلیلی است که بیشتر مردم این مدل را انتخاب میکنند، پس این بخش را دو بار بخوانید.
عبارت دقیق را داخل گیومه بگذارید. هرچه را با کلمات خودتان تعریف کنید، مدل بازنویسیاش میکند. «یک تابلو که به ساعت کاری اشاره کند» ساعتهای ساختگی به شما میدهد؛ عبارت the sign reads "OPEN 8 TO 6" همان کلمات را میدهد.
سطحی را نام ببرید که متن رویش چاپ شده: پوستری چسبانده به دیوار، لیوان کاغذی قهوه، سایبان مغازه، جلد کتاب، صفحه گوشی. سطح، تایپوگرافی و پرسپکتیو و نحوه شکستن حروف را تعیین میکند، و مدل وقتی بداند روی چه چیزی مینویسد، هر سه را بهتر از آب درمیآورد.
زبان را مشخص کنید وقتی انگلیسی نیست. برای فارسی این نکته جدی است، نه تشریفاتی: بنویسید Persian text reading "باز است" روی سطحی که نام بردهاید. بدون این کار، پرامپتهای ترکیبی به حروف لاتین و انگلیسی برمیگردند و بهجای عبارت فارسی یک عبارت انگلیسی روی تابلو مینشیند. حتی با مشخص کردن زبان هم انتظار خطا داشته باشید: حروف جدا از هم و بدون اتصال درست، ترتیب برعکس کلمات، یا شکلهای عربی ی و ک بهجای شکل فارسیشان. راهحل، طولانیتر کردن رشته یا اضافه کردن توضیح نیست، همان پرامپت را دوباره اجرا کنید، و اگر دو اجرا هم شکست خورد، عبارت را کوتاهتر کنید.
کوتاه نگهش دارید. یک تیتر بهعلاوه حداکثر یک خط کمکی سقف قابلاتکاست. قابلیت اتکا بعد از اندازه یک تیتر کوتاه بهشدت افت میکند، و یک پاراگراف کامل متن روی هیچ مدلی که امروز در دسترس است تمیز درنمیآید.
وقتی یک خط بههمریخته برگشت، بهجای اضافه کردن کلمه همان پرامپت را دوباره اجرا کنید. شکل حروف بین اجراها فرق میکند، و با 1 اعتبار برای تصویر 1K، تلاش دوم از بازنویسی ارزانتر است.
این واضحترین شکاف در این مجموعه است: GPT-Image-2 رشتههای کوتاهی را درست مینشاند که NanoBanana 2 معمولاً بههم میریزد. اگر هم متن میخواهید و هم ظاهری نقاشانهتر، راهنمای NanoBanana توضیح میدهد که آن مدل را تا کجا میشود پیش برد.
فیلتر چه چیزهایی را رد میکند
GPT-Image-2 سختگیرترین فیلتر محتوا را میان مدلهای بات دارد. چهار چیز تقریباً همه ردها را توضیح میدهند: افراد واقعی که با نام آورده شوند، نشانها و لوگوهای برند، خشونت، و محتوای صریح. پاسخ رد یک “نه” قاطع است، نه یک تصویر ضعیفشده، پس راهحل همیشه داخل پرامپت است.
با توصیف نوع بهجای نام بردن از نمونه بازنویسی کنید:
بهجای “Keanu Reeves in a black suit on a rainy street” بنویسید “a man in his fifties with long dark hair and a beard, black suit, rainy neon lit street at night, cinematic”.
بهجای “a can of Coca-Cola on a table” بنویسید “a red aluminium soda can with an unbranded white script logo, on a wooden table, studio light”.
هر دو ایده را حفظ میکنند و رد نمیشوند. Seedream فیلتر آزادتری دارد، و راهنمای Seedream توضیح میدهد که واقعاً در چه چیزی بهتر است، عمدتاً کارهای سبکدار و فوقعریض. قوانین آنجا هم برقرارند، پس پرامپتی که بهخاطر اصل موضوع رد شده و نه بهخاطر عبارتبندی، ارزش تغییر مسیر ندارد.
اصلاحهای رایج
| نشانه | چه چیزی را در پرامپت عوض کنید |
|---|---|
| حروف بههمریخته برمیگردند | رشته را کوتاه کنید، داخل گیومه بگذارید، سطح را نام ببرید، بعد بهجای بازنویسی دوباره اجرا کنید |
| مدل تیتر خودش را نوشت | بهجای توصیف پیام، عبارت دقیق را داخل گیومه بدهید |
| عکس پیوست اشتباهی ویرایش شد | مرجعها را شمارهگذاری کنید، @image1 و @image2، و بگویید کدام منبع است و کدام مقصد |
| یکی از دستورها نادیده گرفته شد | جمله را دو تکه کنید، دستور را در بند خودش بگذارید و بگویید چه چیزی باید دستنخورده بماند |
| نتیجه تخت و بیروح است | نور و لنز اضافه کنید: جهت، کیفیت، فاصله کانونی، عمق میدان |
| ویرایش بیشتر از خواسته شما را تغییر داد | ”keep everything else unchanged” اضافه کنید و بخشهایی را که باید حفظ شوند نام ببرید |
پرامپتهای آماده
سریعترین راه یاد گرفتن یک مدل، اجرای پرامپتی است که از قبل جواب میدهد و بعد عوض کردن هر بار فقط یک بخش. کتابخانه پرامپتهای GPT-Image-2 پرامپتهای آماده چسباندن را همراه با تصویرهایی که تولید کردهاند دارد، و صفحه مدل وضوحها، نسبتهای ابعادی و هزینه اعتبارها را فهرست میکند.
بات ما را باز کنید، GPT-Image-2 را انتخاب کنید و یکی را بچسبانید.