Cómo hacer prompts para GPT-Image-2

Guía práctica de prompts para GPT-Image-2: la fórmula del prompt, cómo señalar las fotos adjuntas con @image1, cómo conseguir texto legible dentro de la imagen y qué rechaza el filtro.

GPT-Image-2 lee el prompt de forma literal, así que se le escribe nombrando las cosas en lugar de insinuarlas: el sujeto, lo que está haciendo, la luz, el encuadre y las palabras exactas que quieres impresas dentro de la imagen. Elígelo en el menú de modelos de nuestro bot y luego escribe un mensaje que lo indique todo. Lo que dejes fuera lo rellena el modelo por su cuenta, y esa es la única razón por la que la mayoría de los primeros intentos vuelven con la idea de otra persona.

La fórmula del prompt para GPT-Image-2

Seis ranuras cubren casi cualquier prompt: sujeto, acción, escenario, luz y óptica, encuadre, estilo. Escríbelas en ese orden, en frases sencillas:

A cream colored A3 poster taped by its four corners to a weathered wooden wall, warm side light from the left, shot straight on, the poster reads “FRESH BREW” in bold black letters with a smaller line under it reading “2 FOR 1 UNTIL FRIDAY”, with an illustrated latte cup below the text

El sujeto es aquello de lo que trata la imagen: un sustantivo con dos o tres adjetivos, no una categoría. La acción es lo que está haciendo ahora mismo, que es lo que evita que un retrato parezca una foto de carné. El escenario lo sitúa y trae consigo los objetos: una pared de madera y cinta adhesiva se leen de forma muy distinta a un marco de galería.

La luz y la óptica hacen la mayor parte del trabajo visual: luz lateral cálida, luz de día nublado, una sola lámpara dura, 35 mm angular, 85 mm de retrato con poca profundidad de campo. GPT-Image-2 las aplica literalmente en vez de promediarlas hacia un estilo propio. El encuadre decide primer plano, plano medio o plano general, además del ángulo de cámara. El estilo cierra el prompt: fotorrealista, editorial, ilustración plana, render 3D.

El literalismo corta por los dos lados, y por eso esta fórmula rinde aquí más rápido que en otros modelos. El modelo no va a inventar una atmósfera para tapar un prompt vago, y tampoco va a dejar caer en silencio una instrucción rara. Añade una ranura y verás esa ranura en el siguiente render.

Los dos pósteres que hay más abajo son la misma idea lanzada dos veces. El primero salió de una línea, “a poster about a coffee sale”, y el modelo escribió sus propios textos: un titular, un nombre de marca, un descuento y una fecha de fin, nada de lo cual se había pedido. El segundo nombra las palabras exactas, la superficie y la luz. Nombrar las palabras es lo que pone tus palabras en la imagen en lugar de las del modelo.

Cómo adjuntar fotos: @image1 y @image2

Para editar, envía hasta 4 fotos en un solo mensaje y escribe la instrucción como pie de foto de ese mismo mensaje. Las fotos en un mensaje y el texto en el siguiente son dos mensajes distintos, y no se emparejarán. La guía paso a paso explica esa regla del mensaje único al detalle.

Una vez adjuntas varias fotos, dirígete a ellas por número. GPT-Image-2 sigue estas referencias de cerca, y eso es lo que lo convierte en el especialista en edición:

Put the face from @image1 onto the person in @image2, keep the hairstyle and the jacket from @image2 unchanged, match the skin tone to @image1, studio light, waist up

Di qué hay que conservar con tanta claridad como qué hay que cambiar. “Keep the background unchanged” y “do not alter the pose” son instrucciones que el modelo cumple de verdad, y sin ellas una edición redibuja más cuadro del que querías. Si dejas fuera los números, el modelo decide por su cuenta para qué sirve cada referencia.

En qué es fuerte GPT-Image-2 y en qué no

Fuerte enLe cuesta
Texto legible dentro de la imagenPárrafos largos de texto
Ediciones de fotos a partir de tus propios adjuntosNo tiene opción ultrapanorámica 21:9, que en el bot solo ofrece Seedream
Seguir instrucciones literales de varias partesPrompts sueltos y evocadores de una sola línea
Fotos de producto, carteles, pósteres, envasesTodo lo que marque su filtro estricto
Iteración barata, 1 crédito por imagen de 1KIlustración muy estilizada y arte pictórico

Para arte estilizado, empieza por Seedream; para máxima calidad en una escena compleja, NanoBanana Pro.

Cómo conseguir texto correcto dentro de la imagen

El texto es la razón por la que la mayoría elige este modelo, así que lee esta sección dos veces.

Pon las palabras exactas entre comillas. Todo lo que parafrasees, el modelo lo reescribe. “A sign that mentions the opening hours” te da un horario inventado; the sign reads "OPEN 8 TO 6" te da esas palabras.

Nombra la superficie sobre la que va impreso el texto: un póster pegado a una pared, un vaso de papel, el toldo de una tienda, la portada de un libro, la pantalla de un móvil. La superficie determina la tipografía, la perspectiva y cómo se ajustan las letras, y el modelo maneja mejor las tres cosas cuando sabe sobre qué está escribiendo.

Indica el idioma cuando no sea inglés, por ejemplo Spanish text reading "CAFÉ RECIÉN HECHO" o Cyrillic text reading "ОТКРЫТО". Sin eso, el modelo tiende a devolver el texto en inglés, y en español se come las tildes y la ñ: MAÑANA vuelve como MANANA. Si una palabra lleva tilde o ñ, escríbela entre comillas tal cual y relanza el prompt cuando vuelva sin ellas.

Que sea corto. Un titular más como mucho una línea de apoyo es el techo fiable. La fiabilidad cae en picado en cuanto pasas de las palabras que cabrían en un titular breve, y un párrafo entero de texto corrido no va a salir limpio en ningún modelo disponible hoy.

Cuando una línea vuelva ilegible, relanza el mismo prompt en lugar de añadir palabras. Las letras varían entre generaciones y, a 1 crédito por imagen de 1K, un segundo intento sale más barato que una reescritura. Si dos intentos fallan, acorta el texto.

Esta es la diferencia más clara de la gama: GPT-Image-2 acierta cadenas cortas que NanoBanana 2 tiende a desordenar. Si necesitas texto más un acabado más pictórico, mira la guía de NanoBanana para saber hasta dónde se puede llevar ese modelo.

Qué rechaza el filtro

GPT-Image-2 tiene el filtro de contenido más estricto de los modelos del bot. Cuatro cosas explican casi todos los rechazos: personas reales con nombre, marcas y logotipos, violencia y contenido explícito. El rechazo es un no rotundo, no una imagen degradada, así que el arreglo siempre está en el prompt.

Reescribe describiendo el tipo en vez de nombrar el caso concreto:

En lugar de “Keanu Reeves in a black suit on a rainy street”, escribe “a man in his fifties with long dark hair and a beard, black suit, rainy neon lit street at night, cinematic”.

En lugar de “a can of Coca-Cola on a table”, escribe “a red aluminium soda can with an unbranded white script logo, on a wooden table, studio light”.

Ambos conservan la idea y pasan. Seedream tiene un filtro más permisivo, y la guía de Seedream cubre en qué es realmente mejor, sobre todo en trabajo estilizado y ultrapanorámico. Allí siguen aplicándose las reglas, así que no vale la pena redirigir un prompt que fue rechazado por el fondo y no por la redacción.

Problemas frecuentes y qué cambiar

SíntomaQué cambiar en el prompt
Las letras vuelven ilegiblesAcorta el texto, ponlo entre comillas, nombra la superficie y luego relanza en vez de reescribir
El modelo escribió su propio titularDa las palabras exactas entre comillas en lugar de describir el mensaje
Se editó la foto adjunta equivocadaNumera tus referencias: @image1, @image2, y di cuál es el origen y cuál el destino
Se ignoró una instrucciónParte la frase en dos, deja la instrucción en su propia cláusula y di qué debe quedar intacto
El resultado se ve plano y genéricoAñade luz y óptica: dirección, calidad, distancia focal, profundidad de campo
La edición cambió más de lo que pedisteAñade “keep everything else unchanged” y nombra las partes que hay que conservar

Prompts listos para pegar

La forma más rápida de aprender un modelo es lanzar un prompt que ya funciona y luego cambiar una ranura cada vez. La biblioteca de prompts de GPT-Image-2 tiene prompts listos para pegar junto a las imágenes que produjeron, y la página del modelo lista resoluciones, relaciones de aspecto y coste en créditos.

Abre nuestro bot, elige GPT-Image-2 y pega uno.

Una misma idea, dos prompts

Prompt: 'a poster about a coffee sale'. Generado con GPT-Image-2.
La misma idea con las palabras exactas, la superficie y la luz especificadas. Generado con GPT-Image-2.

Preguntas frecuentes

¿Cómo consigo texto legible dentro de la imagen?

Pon las palabras exactas entre comillas, di sobre qué están escritas (un cartel, un póster, un envase, una etiqueta) y mantenlas cortas. Un titular más una línea breve es mucho más fiable que un párrafo. GPT-Image-2 es el modelo más fuerte del bot en esto.

¿Cómo le digo al modelo qué foto adjunta debe usar?

Envía hasta 4 fotos en un solo mensaje con tu instrucción como pie de foto, y luego refiérete a ellas por número en el prompt: toma la cara de @image1, la chaqueta de @image2. Sin los números, el modelo decide por su cuenta para qué sirve cada referencia.

¿Por qué GPT-Image-2 rechazó mi prompt?

Su filtro de contenido es de los más estrictos del bot. Personas reales con nombre, logotipos de marcas, violencia y contenido explícito son las causas habituales. Describe el tipo de persona o de producto en lugar de nombrar uno real y la misma idea suele pasar.

¿Cuánto cuesta una imagen de GPT-Image-2?

1K cuesta 1 crédito, 2K cuesta 2 y 4K cuesta 3, el nivel más barato del bot, lo que lo convierte en el modelo natural para iterar un prompt. Los créditos no caducan.

zosee es un producto independiente. No está afiliado, respaldado ni patrocinado por Telegram, Google, ByteDance, OpenAI ni Midjourney. Los nombres de los modelos son marcas registradas de sus respectivos propietarios.

Prueba gratis en Telegram

Suscríbete a nuestro canal de prompts @zosee_channel y reclama 5 créditos gratis, suficientes para hasta 5 imágenes. Los créditos no caducan.