چطور برای GPT-Image-2 پرامپت بنویسیم

راهنمای کاربردی پرامپت‌نویسی GPT-Image-2: فرمول پرامپت، ارجاع به عکس‌های پیوست‌شده با ‎@image1، رساندن متن خوانا به داخل تصویر، و چیزهایی که فیلتر رد می‌کند.

GPT-Image-2 پرامپت را تحت‌اللفظی می‌خواند، پس روش پرامپت‌نویسی برایش نام بردن چیزهاست، نه سربسته حرف زدن دربارهٔ آن‌ها: موضوع، کاری که می‌کند، نور، کادربندی، و کلمات دقیقی که می‌خواهید داخل تصویر چاپ شوند. در منوی مدل‌های بات ما انتخابش کنید و یک پیام بنویسید که همه این‌ها را بگوید. هرچه ننویسید، مدل خودش پرش می‌کند، و همین تنها دلیلی است که بیشتر تلاش‌های اول شبیه ایده یک نفر دیگر برمی‌گردند.

فرمول پرامپت GPT-Image-2

شش بخش تقریباً هر پرامپتی را پوشش می‌دهند: موضوع، کنش، محیط، نور و لنز، کادربندی، سبک. به همین ترتیب و با جمله‌های ساده بنویسیدشان:

A cream colored A3 poster taped by its four corners to a weathered wooden wall, warm side light from the left, shot straight on, the poster reads “FRESH BREW” in bold black letters with a smaller line under it reading “2 FOR 1 UNTIL FRIDAY”, with an illustrated latte cup below the text

موضوع همان یک چیزی است که تصویر درباره آن است: یک اسم با دو سه صفت، نه یک دسته‌بندی کلی. کنش کاری است که همین حالا دارد انجام می‌دهد، و همین است که نمی‌گذارد یک پرتره شبیه عکس پاسپورتی شود. محیط آن را جایی می‌نشاند و لوازم صحنه را با خود می‌آورد: دیوار چوبی و چسب کاملاً متفاوت از قاب یک گالری خوانده می‌شوند.

نور و لنز بیشترِ کار بصری را انجام می‌دهد: نور گرم از پهلو، روشنایی روز ابری، یک چراغ سخت، لنز واید 35 میلی‌متری، پرتره 85 میلی‌متری با عمق میدان کم. GPT-Image-2 این‌ها را عیناً اعمال می‌کند و آن‌ها را در یک سبک ثابت و همیشگیِ خودش میانگین نمی‌گیرد. کادربندی نما را تعیین می‌کند، کلوزآپ، تا کمر، یا باز، به‌علاوه زاویه دوربین. سبک پرامپت را می‌بندد: فوتورئالیستیک، ادیتوریال، تصویرسازی فلت، رندر سه‌بعدی.

تحت‌اللفظی بودن دو لبه دارد، و دقیقاً به همین دلیل این فرمول اینجا زودتر از هر جای دیگری جواب می‌دهد. مدل برای پوشاندن یک پرامپت مبهم اتمسفر از خودش نمی‌سازد، و یک دستور عجیب را هم بی‌سروصدا کنار نمی‌گذارد. یک بخش اضافه کنید، همان بخش را در رندر بعدی می‌بینید.

دو پوستر پایین همین صفحه یک ایده هستند که دو بار اجرا شده. اولی از یک خط آمده، “a poster about a coffee sale”، و مدل متن خودش را نوشته: یک تیتر، یک نام برند، یک تخفیف و یک تاریخ پایان، که هیچ‌کدام خواسته نشده بودند. دومی متن دقیق، سطح و نور را نام می‌برد. نام بردن کلمات همان کاری است که کلمات شما را به‌جای کلمات مدل داخل تصویر می‌گذارد.

پیوست کردن عکس: @image1 و @image2

برای ویرایش، تا 4 عکس را در یک پیام بفرستید و دستور را به‌عنوان توضیح همان پیام بنویسید. عکس در یک پیام و متن در پیام بعدی دو پیام جداگانه‌اند و با هم جفت نمی‌شوند. راهنمای قدم‌به‌قدم این قانون یک‌پیامی را کامل توضیح می‌دهد.

وقتی چند عکس پیوست شد، با شماره خطاب‌شان کنید. GPT-Image-2 این ارجاع‌ها را دقیق دنبال می‌کند و همین آن را به متخصص ویرایش تبدیل کرده است:

Put the face from @image1 onto the person in @image2, keep the hairstyle and the jacket from @image2 unchanged, match the skin tone to @image1, studio light, waist up

آنچه را باید حفظ شود به همان صراحتِ آنچه باید تغییر کند بنویسید. “Keep the background unchanged” و “do not alter the pose” دستورهایی هستند که مدل واقعاً اجرا می‌کند، و بدون آن‌ها یک ویرایش بخش بیشتری از کادر را از نو می‌کشد. شماره‌ها را حذف کنید و مدل خودش تصمیم می‌گیرد کدام مرجع برای چیست.

GPT-Image-2 کجا قوی است و کجا نیست

قوی درضعیف در
متن خوانا داخل تصویرپاراگراف‌های طولانی متن
ویرایش عکس از روی پیوست‌های خودتاننداشتن نسبت فوق‌عریض 21:9؛ در بات فقط Seedream آن را دارد
دنبال کردن دستورهای تحت‌اللفظی و چندبخشیپرامپت‌های یک‌خطی، شاعرانه و رها
عکس محصول، تابلو، پوستر، بسته‌بندیهر چیزی که فیلتر سخت‌گیرش علامت بزند
تکرار ارزان با 1 اعتبار برای تصویر 1Kتصویرسازی به‌شدت سبک‌دار و کارهای نقاشانه

برای هنر سبک‌دار از Seedream شروع کنید، و برای حداکثر کیفیت روی یک صحنه پیچیده از NanoBanana Pro.

درست درآوردن متن داخل تصویر

متن همان دلیلی است که بیشتر مردم این مدل را انتخاب می‌کنند، پس این بخش را دو بار بخوانید.

عبارت دقیق را داخل گیومه بگذارید. هرچه را با کلمات خودتان تعریف کنید، مدل بازنویسی‌اش می‌کند. «یک تابلو که به ساعت کاری اشاره کند» ساعت‌های ساختگی به شما می‌دهد؛ عبارت the sign reads "OPEN 8 TO 6" همان کلمات را می‌دهد.

سطحی را نام ببرید که متن رویش چاپ شده: پوستری چسبانده به دیوار، لیوان کاغذی قهوه، سایبان مغازه، جلد کتاب، صفحه گوشی. سطح، تایپوگرافی و پرسپکتیو و نحوه شکستن حروف را تعیین می‌کند، و مدل وقتی بداند روی چه چیزی می‌نویسد، هر سه را بهتر از آب درمی‌آورد.

زبان را مشخص کنید وقتی انگلیسی نیست. برای فارسی این نکته جدی است، نه تشریفاتی: بنویسید Persian text reading "باز است" روی سطحی که نام برده‌اید. بدون این کار، پرامپت‌های ترکیبی به حروف لاتین و انگلیسی برمی‌گردند و به‌جای عبارت فارسی یک عبارت انگلیسی روی تابلو می‌نشیند. حتی با مشخص کردن زبان هم انتظار خطا داشته باشید: حروف جدا از هم و بدون اتصال درست، ترتیب برعکس کلمات، یا شکل‌های عربی ی و ک به‌جای شکل فارسی‌شان. راه‌حل، طولانی‌تر کردن رشته یا اضافه کردن توضیح نیست، همان پرامپت را دوباره اجرا کنید، و اگر دو اجرا هم شکست خورد، عبارت را کوتاه‌تر کنید.

کوتاه نگهش دارید. یک تیتر به‌علاوه حداکثر یک خط کمکی سقف قابل‌اتکاست. قابلیت اتکا بعد از اندازه یک تیتر کوتاه به‌شدت افت می‌کند، و یک پاراگراف کامل متن روی هیچ مدلی که امروز در دسترس است تمیز درنمی‌آید.

وقتی یک خط به‌هم‌ریخته برگشت، به‌جای اضافه کردن کلمه همان پرامپت را دوباره اجرا کنید. شکل حروف بین اجراها فرق می‌کند، و با 1 اعتبار برای تصویر 1K، تلاش دوم از بازنویسی ارزان‌تر است.

این واضح‌ترین شکاف در این مجموعه است: GPT-Image-2 رشته‌های کوتاهی را درست می‌نشاند که NanoBanana 2 معمولاً به‌هم می‌ریزد. اگر هم متن می‌خواهید و هم ظاهری نقاشانه‌تر، راهنمای NanoBanana توضیح می‌دهد که آن مدل را تا کجا می‌شود پیش برد.

فیلتر چه چیزهایی را رد می‌کند

GPT-Image-2 سخت‌گیرترین فیلتر محتوا را میان مدل‌های بات دارد. چهار چیز تقریباً همه ردها را توضیح می‌دهند: افراد واقعی که با نام آورده شوند، نشان‌ها و لوگوهای برند، خشونت، و محتوای صریح. پاسخ رد یک “نه” قاطع است، نه یک تصویر ضعیف‌شده، پس راه‌حل همیشه داخل پرامپت است.

با توصیف نوع به‌جای نام بردن از نمونه بازنویسی کنید:

به‌جای “Keanu Reeves in a black suit on a rainy street” بنویسید “a man in his fifties with long dark hair and a beard, black suit, rainy neon lit street at night, cinematic”.

به‌جای “a can of Coca-Cola on a table” بنویسید “a red aluminium soda can with an unbranded white script logo, on a wooden table, studio light”.

هر دو ایده را حفظ می‌کنند و رد نمی‌شوند. Seedream فیلتر آزادتری دارد، و راهنمای Seedream توضیح می‌دهد که واقعاً در چه چیزی بهتر است، عمدتاً کارهای سبک‌دار و فوق‌عریض. قوانین آنجا هم برقرارند، پس پرامپتی که به‌خاطر اصل موضوع رد شده و نه به‌خاطر عبارت‌بندی، ارزش تغییر مسیر ندارد.

اصلاح‌های رایج

نشانهچه چیزی را در پرامپت عوض کنید
حروف به‌هم‌ریخته برمی‌گردندرشته را کوتاه کنید، داخل گیومه بگذارید، سطح را نام ببرید، بعد به‌جای بازنویسی دوباره اجرا کنید
مدل تیتر خودش را نوشتبه‌جای توصیف پیام، عبارت دقیق را داخل گیومه بدهید
عکس پیوست اشتباهی ویرایش شدمرجع‌ها را شماره‌گذاری کنید، @image1 و @image2، و بگویید کدام منبع است و کدام مقصد
یکی از دستورها نادیده گرفته شدجمله را دو تکه کنید، دستور را در بند خودش بگذارید و بگویید چه چیزی باید دست‌نخورده بماند
نتیجه تخت و بی‌روح استنور و لنز اضافه کنید: جهت، کیفیت، فاصله کانونی، عمق میدان
ویرایش بیشتر از خواسته شما را تغییر داد”keep everything else unchanged” اضافه کنید و بخش‌هایی را که باید حفظ شوند نام ببرید

پرامپت‌های آماده

سریع‌ترین راه یاد گرفتن یک مدل، اجرای پرامپتی است که از قبل جواب می‌دهد و بعد عوض کردن هر بار فقط یک بخش. کتابخانه پرامپت‌های GPT-Image-2 پرامپت‌های آماده چسباندن را همراه با تصویرهایی که تولید کرده‌اند دارد، و صفحه مدل وضوح‌ها، نسبت‌های ابعادی و هزینه اعتبارها را فهرست می‌کند.

بات ما را باز کنید، GPT-Image-2 را انتخاب کنید و یکی را بچسبانید.

یک ایده، دو پرامپت

پرامپت: 'a poster about a coffee sale'. تولیدشده با GPT-Image-2.
همان ایده، این بار با متن دقیق، سطح و نور مشخص‌شده. تولیدشده با GPT-Image-2.

پرسش‌های متداول

چطور متن خوانا داخل تصویر بگیرم؟

عبارت دقیق را داخل گیومه بگذارید، بگویید روی چه چیزی نوشته شده (تابلو، پوستر، بسته‌بندی، برچسب) و کوتاه نگهش دارید. یک تیتر به‌علاوه یک خط کوتاه به‌مراتب قابل‌اتکاتر از یک پاراگراف است. GPT-Image-2 قوی‌ترین مدل بات برای این کار است.

چطور بگویم کدام عکس پیوست‌شده را استفاده کند؟

تا 4 عکس را در یک پیام بفرستید و دستورتان را به‌عنوان توضیح همان پیام بنویسید، بعد در پرامپت با شماره به آن‌ها ارجاع دهید: take the face from @image1, the jacket from @image2.‎ بدون شماره‌گذاری، خود مدل تصمیم می‌گیرد کدام مرجع برای چیست.

چرا GPT-Image-2 پرامپت من را رد کرد؟

فیلتر محتوای آن از سخت‌گیرترین‌های بات است. نام بردن از افراد واقعی، لوگوی برندها، خشونت و محتوای صریح دلایل همیشگی هستند. به‌جای نام بردن از یک شخص یا محصول واقعی، نوع آن را توصیف کنید تا همان ایده معمولاً بدون مشکل ساخته شود.

هر تصویر GPT-Image-2 چقدر هزینه دارد؟

1 اعتبار روی 1K، 2 اعتبار روی 2K و 3 اعتبار روی 4K، ارزان‌ترین سطح بات، و به همین دلیل مدل طبیعی برای تکرار و اصلاح پرامپت است. اعتبارها هرگز منقضی نمی‌شوند.

zosee یک محصول مستقل است. وابسته به تلگرام، گوگل، ByteDance، OpenAI یا Midjourney نیست و مورد تأیید یا حمایت آن‌ها قرار ندارد. نام مدل‌ها علامت تجاری صاحبان مربوطه است.

امتحان رایگان در تلگرام

در کانال پرامپت ما @zosee_channel عضو شوید و 5 اعتبار رایگان بگیرید، کافی برای تا 5 تصویر. اعتبارها هرگز منقضی نمی‌شوند.