GPT-Image-2 lit un prompt au pied de la lettre. Vous le pilotez donc en nommant les choses au lieu de les suggérer : le sujet, ce qu’il fait, la lumière, le cadrage et les mots exacts que vous voulez voir imprimés dans l’image. Choisissez-le dans le menu des modèles du bot, puis écrivez un seul message qui dit tout cela. Tout ce que vous omettez, le modèle le comble de lui-même, et c’est la seule raison pour laquelle la plupart des premiers essais reviennent avec l’idée de quelqu’un d’autre.
La formule de prompt GPT-Image-2
Six éléments couvrent presque tous les prompts : sujet, action, décor, lumière et objectif, cadrage, style. Écrivez-les dans cet ordre, en phrases simples :
A cream colored A3 poster taped by its four corners to a weathered wooden wall, warm side light from the left, shot straight on, the poster reads “FRESH BREW” in bold black letters with a smaller line under it reading “2 FOR 1 UNTIL FRIDAY”, with an illustrated latte cup below the text
Le sujet est la seule chose dont parle l’image : un nom avec deux ou trois adjectifs, pas une catégorie. L’action est ce qu’il est en train de faire, et c’est ce qui empêche un portrait de ressembler à une photo d’identité. Le décor le situe et apporte les accessoires : un mur en bois et du scotch se lisent très différemment d’un cadre de galerie.
La lumière et l’objectif font l’essentiel du travail visuel : lumière latérale chaude, lumière du jour couverte, une seule lampe dure, 35 mm large, 85 mm portrait avec faible profondeur de champ. GPT-Image-2 les applique littéralement au lieu de les fondre dans un style maison. Le cadrage décide du gros plan, du plan taille ou du plan large, ainsi que de l’angle de caméra. Le style referme le prompt : photoréaliste, éditorial, illustration à plat, rendu 3D.
Ce littéralisme joue dans les deux sens, et c’est pourquoi cette formule paie plus vite ici qu’ailleurs. Le modèle n’inventera pas une ambiance pour couvrir un prompt vague, et il ne laissera pas non plus tomber discrètement une consigne bizarre. Ajoutez un élément, et vous le voyez apparaître au rendu suivant.
Les deux affiches plus bas dans la page reprennent la même idée, générée deux fois. La première vient d’une seule ligne, « a poster about a coffee sale », et le modèle a écrit son propre texte : un titre, un nom de marque, une remise et une date de fin, dont rien n’avait été demandé. La seconde nomme les mots exacts, le support et la lumière. Nommer les mots, c’est ce qui met vos mots dans l’image plutôt que ceux du modèle.
Joindre des photos : @image1 et @image2
Pour l’édition, envoyez jusqu’à 4 photos dans un seul message et écrivez la consigne en légende de ce même message. Des photos dans un message et le texte dans le suivant font deux messages distincts, et ils ne seront pas associés. Le guide étape par étape détaille cette règle du message unique.
Une fois plusieurs photos jointes, désignez-les par leur numéro. GPT-Image-2 suit ces références de près, et c’est ce qui en fait le spécialiste de l’édition :
Put the face from @image1 onto the person in @image2, keep the hairstyle and the jacket from @image2 unchanged, match the skin tone to @image1, studio light, waist up
Dites ce qu’il faut conserver aussi explicitement que ce qu’il faut changer. « Keep the background unchanged » et « do not alter the pose » sont des consignes que le modèle suit vraiment, et sans elles, une retouche modifie une plus grande partie de l’image que vous ne le vouliez. Retirez les numéros et le modèle décide lui-même de l’usage de chaque référence.
Là où GPT-Image-2 est fort, et là où il ne l’est pas
| Points forts | Difficultés |
|---|---|
| Texte lisible dans l’image | Longs paragraphes de texte |
| Éditions à partir de vos propres photos jointes | Pas de format ultra-large 21:9, que seul Seedream propose dans le bot |
| Suivi de consignes littérales en plusieurs parties | Prompts d’une ligne, vagues et évocateurs |
| Photos de produits, enseignes, affiches, emballages | Tout ce que le filtre strict signale |
| Itération économique, 1 crédit pour une image 1K | Illustration très stylisée et art pictural |
Pour l’art stylisé, commencez par Seedream ; pour la qualité maximale sur une scène complexe, NanoBanana Pro.
Réussir le texte dans l’image
C’est pour le texte que la plupart des gens choisissent ce modèle : lisez cette section deux fois.
Mettez les mots exacts entre guillemets. Tout ce que vous paraphrasez, le modèle le réécrit. « Un panneau qui mentionne les horaires d’ouverture » vous donne des horaires inventés ; the sign reads "OPEN 8 TO 6" vous donne ces mots-là.
Nommez le support sur lequel le texte est imprimé : une affiche scotchée à un mur, un gobelet en carton, un store de boutique, une couverture de livre, un écran de téléphone. Le support détermine la typographie, la perspective et la façon dont les lettres se répartissent, et le modèle gère mieux les trois quand il sait sur quoi il écrit.
Précisez la langue quand ce n’est pas l’anglais, par exemple French text reading "CAFÉ OUVERT DÈS 7H" ou Cyrillic text reading "ОТКРЫТО". Sans cette précision, le modèle a tendance à répondre en anglais, et quand il écrit bien en français, il avale les accents et les ligatures : FERMÉ revient en FERME, CŒUR en COEUR. Dès qu’un mot porte un accent, une cédille ou un œ, écrivez-le tel quel entre guillemets et relancez le rendu tant qu’il revient sans.
Faites court. Un titre, plus une ligne secondaire au maximum : c’est la limite fiable. La fiabilité chute nettement au-delà de la longueur d’un titre court, et un paragraphe entier de texte courant ne sortira proprement sur aucun modèle disponible aujourd’hui.
Quand une ligne revient brouillée, relancez le même prompt au lieu d’ajouter des mots. Le lettrage varie d’un rendu à l’autre, et à 1 crédit l’image 1K un second essai coûte moins cher qu’une réécriture. Si deux rendus échouent, raccourcissez le texte.
C’est l’écart le plus net de la gamme : GPT-Image-2 réussit les textes courts que NanoBanana 2 a tendance à brouiller. S’il vous faut du texte avec un rendu plus pictural, voyez le guide NanoBanana pour savoir jusqu’où pousser ce modèle.
Ce que le filtre refuse
GPT-Image-2 a le filtre de contenu le plus strict des modèles du bot. Quatre choses expliquent presque tous les refus : les personnalités réelles nommées, les marques et logos, la violence et le contenu explicite. Le refus est un non net, pas une image dégradée, donc la correction est toujours dans le prompt.
Réécrivez en décrivant le type plutôt qu’en nommant l’exemplaire :
Au lieu de “Keanu Reeves in a black suit on a rainy street”, écrivez “a man in his fifties with long dark hair and a beard, black suit, rainy neon lit street at night, cinematic”.
Au lieu de “a can of Coca-Cola on a table”, écrivez “a red aluminium soda can with an unbranded white script logo, on a wooden table, studio light”.
Les deux gardent l’idée et passent. Seedream a un filtre plus permissif, et le guide Seedream explique ce qu’il fait réellement mieux, surtout le stylisé et l’ultra-large. Les règles s’y appliquent toujours : un prompt refusé sur le fond, et non sur la formulation, ne vaut pas la peine d’être réorienté.
Corrections courantes
| Symptôme | Correction du prompt |
|---|---|
| Le lettrage revient brouillé | Raccourcissez le texte, mettez-le entre guillemets, nommez le support, puis relancez au lieu de réécrire |
| Le modèle a écrit son propre titre | Donnez les mots exacts entre guillemets au lieu de décrire le message |
| La mauvaise photo jointe a été éditée | Numérotez vos références, @image1, @image2, et dites laquelle est la source et laquelle la cible |
| Une consigne a été ignorée | Coupez la phrase en deux, mettez la consigne dans sa propre proposition et dites ce qui doit rester inchangé |
| Le résultat est plat et générique | Ajoutez lumière et objectif : direction, qualité, focale, profondeur de champ |
| L’édition a changé plus que demandé | Ajoutez « keep everything else unchanged » et nommez les parties à préserver |
Prompts prêts à l’emploi
La façon la plus rapide d’apprendre un modèle est de lancer un prompt qui fonctionne déjà, puis de changer un élément à la fois. La bibliothèque de prompts GPT-Image-2 rassemble des prompts prêts à coller avec les images qu’ils ont produites, et la page du modèle liste les résolutions, les formats d’image et les coûts en crédits.
Ouvrez le bot, choisissez GPT-Image-2 et collez-en un.