Как писать промпты для GPT-Image-2

Практическое руководство по промптам для GPT-Image-2: формула промпта, как ссылаться на прикреплённые фото через @image1, как получить читаемый текст на изображении и что отклоняет фильтр.

GPT-Image-2 читает промпт буквально, поэтому промпт для него строится на прямых названиях, а не на намёках: объект, его действие, свет, кадрирование и точные слова, которые должны быть напечатаны внутри картинки. Выберите модель в меню нашего бота и напишите одно сообщение, где сказано всё это сразу. Всё, что вы не указали, модель придумает сама, и поэтому первая попытка чаще всего выглядит как чья-то чужая идея.

Формула промпта для GPT-Image-2

Шесть слотов покрывают почти любой промпт: объект, действие, обстановка, свет и оптика, кадрирование, стиль. Пишите их в этом порядке, обычными предложениями:

A cream colored A3 poster taped by its four corners to a weathered wooden wall, warm side light from the left, shot straight on, the poster reads “FRESH BREW” in bold black letters with a smaller line under it reading “2 FOR 1 UNTIL FRIDAY”, with an illustrated latte cup below the text

Объект это то единственное, о чём изображение: существительное с двумя-тремя прилагательными, а не категория. Действие это то, что происходит прямо сейчас, именно оно не даёт портрету превратиться в фото на паспорт. Обстановка помещает объект в конкретное место и добавляет реквизит: деревянная стена и скотч читаются совсем не так, как галерейная рама.

Свет и оптика делают основную визуальную работу: тёплый боковой свет, пасмурный дневной, одна жёсткая лампа, широкие 35 мм, портретные 85 мм с малой глубиной резкости. GPT-Image-2 применяет их буквально, а не усредняет в свой фирменный стиль. Кадрирование решает, будет это крупный план, поясной портрет или общий план, плюс ракурс камеры. Стиль закрывает промпт: фотореализм, редакционная съёмка, плоская иллюстрация, 3D-рендер.

Буквальность работает в обе стороны, и поэтому здесь формула окупается быстрее, чем где-либо ещё. Модель не станет придумывать атмосферу, чтобы прикрыть расплывчатый промпт, но и не выбросит незаметно странную инструкцию. Добавили слот, и в следующей генерации вы этот слот увидите.

Два постера ниже на странице это одна и та же идея, запущенная дважды. Первый вырос из одной строки, “a poster about a coffee sale”, и модель сочинила текст сама: заголовок, название бренда, скидку и дату окончания, о которых никто не просил. Во втором названы точная формулировка, поверхность и свет. Именно названные слова помещают в картинку ваш текст вместо текста модели.

Как прикреплять фото: @image1 и @image2

Для редактирования отправьте до 4 фото в одном сообщении, а инструкцию напишите подписью к этому же сообщению. Фото в одном сообщении и текст в следующем это два разных сообщения, и в пару они не свяжутся. Пошаговое руководство разбирает правило одного сообщения полностью.

Когда прикреплено несколько фото, обращайтесь к ним по номерам. GPT-Image-2 следует таким ссылкам точно, и именно это делает его специалистом по редактированию:

Put the face from @image1 onto the person in @image2, keep the hairstyle and the jacket from @image2 unchanged, match the skin tone to @image1, studio light, waist up

Говорите, что сохранить, так же явно, как и что изменить. “Keep the background unchanged” и “do not alter the pose” это инструкции, которым модель действительно следует, а без них правка перерисовывает больше кадра, чем вы хотели. Уберите номера, и модель сама решит, какой референс для чего.

В чём GPT-Image-2 силён, а в чём нет

Сильные стороныСлабые места
Читаемый текст на изображенииДлинные абзацы текста
Правки по вашим собственным фотоНет сверхширокого 21:9: в боте он есть только у Seedream
Следование буквальным составным инструкциямРасплывчатые образные промпты в одну строку
Предметная съёмка, вывески, постеры, упаковкаВсё, что помечает строгий фильтр
Дешёвые итерации, 1 кредит за изображение 1KСильно стилизованная иллюстрация и живописный арт

Для стилизованного арта начинайте с Seedream, а ради максимального качества на сложной сцене берите NanoBanana Pro.

Как добиться правильного текста на изображении

Ради текста эту модель и выбирают чаще всего, так что прочитайте этот раздел дважды.

Пишите точную формулировку в кавычках. Всё, что вы перескажете своими словами, модель перепишет. “A sign that mentions the opening hours” даст выдуманные часы работы, а the sign reads "OPEN 8 TO 6" даст именно эти слова.

Называйте поверхность, на которой напечатан текст: постер на стене, бумажный кофейный стакан, вывеска над входом, обложка книги, экран телефона. Поверхность задаёт типографику, перспективу и перенос строк, и все три модель отрабатывает лучше, когда знает, на чём пишет.

Указывайте язык, если это не английский, например Cyrillic text reading "ОТКРЫТО". Без этого промпты со смешанными алфавитами сползают обратно к латинице.

Держите текст коротким. Один заголовок плюс максимум одна вспомогательная строка это надёжный потолок. Дальше короткого заголовка надёжность падает резко, а целый абзац текста сегодня не отрисует без ошибок ни одна доступная модель.

Если строка вернулась искажённой, перезапустите тот же промпт, а не дописывайте слова. Начертание меняется от запуска к запуску, а при 1 кредите за изображение 1K вторая попытка дешевле переписывания. Если обе попытки провалились, сократите строку.

Это самый заметный разрыв в линейке: GPT-Image-2 вытягивает короткие строки, которые NanoBanana 2 обычно путает. Если нужен текст вместе с более живописной подачей, в руководстве по NanoBanana написано, до какого предела можно дожать эту модель.

Что отклоняет фильтр

У GPT-Image-2 самый строгий фильтр контента среди моделей бота. Почти все отказы приходятся на четыре вещи: реальные люди по имени, марки и логотипы брендов, насилие и откровенный контент. Отказ приходит как прямое “нет”, а не как ухудшенное изображение, поэтому чинить всегда нужно промпт.

Переписывайте так, чтобы описывать тип, а не называть конкретный экземпляр:

Вместо “Keanu Reeves in a black suit on a rainy street” напишите “a man in his fifties with long dark hair and a beard, black suit, rainy neon lit street at night, cinematic”.

Вместо “a can of Coca-Cola on a table” напишите “a red aluminium soda can with an unbranded white script logo, on a wooden table, studio light”.

Оба варианта сохраняют идею и проходят. У Seedream фильтр мягче, и руководство по Seedream разбирает, в чём эта модель действительно лучше, в основном в стилизованной и сверхширокой работе. Правила там те же, так что промпт, отклонённый по сути, а не по формулировке, переносить туда бессмысленно.

Частые проблемы и что исправить

СимптомЧто поменять в промпте
Буквы возвращаются искажённымиСократите строку, возьмите её в кавычки, назовите поверхность и перезапустите, а не переписывайте
Модель сочинила свой заголовокДайте точную формулировку в кавычках вместо описания смысла надписи
Отредактировано не то прикреплённое фотоПронумеруйте референсы, @image1, @image2, и скажите, какой источник, а какой цель
Одна инструкция проигнорированаРазбейте предложение надвое, вынесите инструкцию в отдельную часть и укажите, что должно остаться без изменений
Результат выглядит плоским и безликимДобавьте свет и оптику: направление, характер, фокусное расстояние, глубину резкости
Правка изменила больше, чем просилиДобавьте “keep everything else unchanged” и перечислите, что нужно сохранить

Готовые промпты

Быстрее всего модель осваивается на промпте, который уже работает: запустите его и меняйте по одному слоту за раз. В библиотеке промптов GPT-Image-2 собраны готовые к вставке промпты вместе с изображениями, которые они дали, а на странице модели перечислены разрешения, соотношения сторон и стоимость в кредитах.

Откройте нашего бота, выберите GPT-Image-2 и вставьте любой из них.

Одна идея, два промпта

Промпт: 'a poster about a coffee sale'. Сгенерировано в GPT-Image-2.
Та же идея, но с точной формулировкой, поверхностью и светом. Сгенерировано в GPT-Image-2.

Частые вопросы

Как получить читаемый текст на изображении?

Напишите точную формулировку в кавычках, укажите, на чём она написана (вывеска, постер, упаковка, этикетка), и держите её короткой. Заголовок плюс одна короткая строка работают куда надёжнее целого абзаца. GPT-Image-2 сильнее всех моделей в боте справляется с этой задачей.

Как указать модели, какое из прикреплённых фото использовать?

Отправьте до 4 фото в одном сообщении, а инструкцию напишите подписью к нему, затем ссылайтесь на фото по номерам в промпте: взять лицо с @image1, куртку с @image2. Без номеров модель сама решает, что для чего.

Почему GPT-Image-2 отклонил мой промпт?

Его фильтр контента один из самых строгих в боте. Обычные причины: названные реальные люди, логотипы брендов, насилие и откровенный контент. Опишите тип человека или товара вместо конкретного имени, и та же идея обычно проходит.

Сколько стоит изображение в GPT-Image-2?

1K стоит 1 кредит, 2K стоит 2, а 4K стоит 3, самый дешёвый уровень в боте, поэтому на нём и удобнее всего отрабатывать промпт. Кредиты не сгорают.

zosee, независимый продукт. Не связан с Telegram, Google, ByteDance, OpenAI или Midjourney, не одобрен и не спонсируется ими. Названия моделей являются товарными знаками их владельцев.

Попробовать бесплатно в Telegram

Подпишитесь на наш канал с промптами @zosee_channel и заберите 5 бесплатных кредитов, этого хватит на 5 изображений. Кредиты не сгорают.