The Specialty News
IA

OpenAI apprend à ChatGPT Images 2.5 à conserver son travail, les vitesses d'édition bondissent de 4x

Le modèle qui génère 3 milliards d'images par semaine permet désormais aux utilisateurs de verrouiller l'apparence d'un personnage et de modifier un seul détail sans réécrire toute l'image.

Par The Specialty News DeskÉdité par 4 min read
OpenAI apprend à ChatGPT Images 2.5 à conserver son travail, les vitesses d'édition bondissent de 4x
Photo: OpenAI

La partie la plus difficile de la génération d'images par IA n'a jamais été la première image, c'était la deuxième. Pendant des années, demander à un modèle de modifier un arrière-plan ou de changer la couleur d'une chemise impliquait de risquer la composition entière, le système réécrivant de manière imprévisible les visages, l'éclairage et la mise en page. Avec la sortie de ChatGPT Images 2.5, OpenAI a résolu le problème du « deuxième prompt ». Les utilisateurs peuvent désormais pointer exactement ce qu'ils veulent modifier, et le modèle comprend ce qu'il ne faut pas toucher.

Générer 3 milliards d'idées par semaine

Pour comprendre pourquoi une édition cohérente est importante, il suffit de regarder l'ampleur de la production. Les gens génèrent des images via ChatGPT et l'API d'OpenAI à un rythme effréné.

Il a fallu des décennies à l'humanité pour capturer 3 milliards de photographies analogiques. Aujourd'hui, ce volume est une norme hebdomadaire. Pour soutenir cette habitude, Images 2.5 introduit des vitesses de génération jusqu'à 50 pour cent plus rapides que la version précédente, les premiers testeurs de l'API enregistrant des flux de travail deux à quatre fois plus rapides. Mais la vitesse sans contrôle n'est qu'un bruit plus rapide.

Le véritable changement réside dans la façon dont la mise à jour modifie l'interaction des gens avec leurs propres idées. Les ingénieurs d'OpenAI ont conçu cette version autour d'un seul constat: les utilisateurs ne veulent pas être des ingénieurs de prompt. Ils veulent être des directeurs artistiques.

Au lieu de taper des paragraphes de texte descriptif en espérant que la machine déduise la bonne mise en page, les utilisateurs peuvent désormais employer un outil appelé Sketch. Ils peuvent dessiner un croquis grossier au doigt directement sur une image dans ChatGPT, ajouter un court commentaire comme « rendre cela noir mat », et laisser le modèle faire le reste. La question était de savoir si cette précision tiendrait la route en production commerciale.

La fin de l'ingénieur de prompt

La fin de l'ingénieur de prompt
Photo: openai.com

Jusqu'à cette semaine, le design par IA était en réalité une machine à sous. Si une équipe marketing aimait un personnage généré mais avait besoin qu'il se tienne dans une pièce différente, tirer à nouveau le levier signifiait risquer l'identité visuelle fondamentale du personnage. Le storyboard et le prototypage de produits stagnaient car le résultat était trop fragile pour être itéré.

« Ce qui nous a le plus impressionnés avec GPT‑Image‑2.5 Flare, c'est sa capacité à comprendre ce qu'il ne faut pas changer. Vous pouvez effectuer une modification significative sans perdre le personnage, la composition ou l'identité visuelle de l'image originale. » — Axultan Alimkulov, Directeur produit chez Higgsfield AI

OpenAI a officialisé cette nouvelle stabilité en divisant son API en deux outils spécifiques. Les développeurs peuvent choisir Flare pour des itérations rapides et à fort volume, ou passer à Sunburst pour une génération commerciale premium plus lente où un contrôle parfait des pixels est obligatoire. Cette structure permet aux développeurs d'entreprise de concevoir des flux de travail fiables qui ne se dégradent pas après cinq ou six révisions. La capacité est si robuste que les concurrents historiques l'absorbent plutôt que de la combattre. Adobe intègre déjà ces modèles GPT Image 2.5 directement dans son flux de travail Firefly. Le prochain obstacle est de rendre la couche finale du design, le texte lui-même, tout aussi obéissant.

Ce qu'il reste à résoudre

Bien que la fidélité visuelle d'Images 2.5 soit un problème résolu pour la plupart des utilisateurs, la typographie reste un défi tenace. La génération de texte s'améliore, mais elle n'est pas parfaitement autonome. Pour éviter que de longues phrases ne se dégradent en charabia, les utilisateurs doivent encore employer des astuces de formatage strictes, comme l'utilisation de citations exactes et la nomination explicite de la hiérarchie typographique dans leurs prompts.

La véritable itération haute fidélité a également un coût informatique. Pour obtenir les modifications multi-tours les plus propres possibles sans artefacts, les développeurs doivent utiliser le modèle Sunburst, plus lourd. Cela sacrifie la vitesse de génération pour garantir le contrôle sans erreur requis pour les campagnes haut de gamme.

Ce sont des compromis pratiques pour un système qui a définitivement déplacé la norme du travail visuel. Quiconque a une idée peut désormais commencer avec une photo de référence, verrouiller l'apparence d'un personnage et itérer en toute confiance au fil d'une longue conversation interactive. L'ère où l'on tirait le levier d'une machine à sous en priant pour obtenir les bons pixels est révolue. Les designers ont enfin un volant.

Images 2.5 Solves the Second Prompt

A visual summary of this story

The Brief

Restez curieux

IA et technologie : ce qui change et pourquoi cela compte.
Votre sélection quotidienne, en anglais ou en espagnol.

Gratuit pour toujours. Désabonnement à tout moment.

Conversation

Lancer la conversation

Aucun compte requis. Les commentaires sont vérifiés automatiquement — restez courtois.

Plus d'articles

Continuer la lecture