The Specialty News
IA

OpenAI enseña a ChatGPT Images 2.5 a mantener su trabajo y la velocidad de edición se cuadruplica

El modelo que impulsa 3.000 millones de generaciones semanales ahora permite a los usuarios fijar el parecido de un personaje y cambiar un solo detalle sin reescribir todo el encuadre.

Por The Specialty News DeskEditado por 4 min read
OpenAI enseña a ChatGPT Images 2.5 a mantener su trabajo y la velocidad de edición se cuadruplica
Foto: OpenAI

La parte más difícil de la generación de imágenes por IA nunca fue la primera imagen, fue la segunda. Durante años, pedirle a un modelo que ajustara un fondo o cambiara el color de una camisa significaba arriesgar toda la composición, ya que el sistema reescribía de manera impredecible las caras, la iluminación y el diseño. Con el lanzamiento de ChatGPT Images 2.5, OpenAI ha resuelto el problema del "segundo prompt". Los usuarios ahora pueden señalar exactamente lo que quieren cambiar, y el modelo entiende qué debe dejar intacto.

Generando 3.000 millones de ideas a la semana

Para entender por qué importa la edición consistente, basta con mirar la enorme escala de producción. La gente está generando imágenes a través de ChatGPT y la API de OpenAI a un ritmo vertiginoso.

A la humanidad le tomó décadas capturar 3.000 millones de fotografías analógicas. Hoy, ese volumen es una base semanal. Para respaldar ese hábito, Images 2.5 introduce velocidades de generación hasta un 50 por ciento más rápidas que la versión anterior, y los primeros evaluadores de la API registran flujos de trabajo entre dos y cuatro veces más rápidos. Pero la velocidad sin control es solo ruido más rápido.

El verdadero cambio es cómo la actualización transforma la forma en que las personas interactúan con sus propias ideas. Los ingenieros de OpenAI construyeron este lanzamiento en torno a una única conclusión: los usuarios no quieren ser ingenieros de prompts. Quieren ser directores de arte.

En lugar de escribir párrafos de texto descriptivo y esperar que la máquina infiera el diseño correcto, los usuarios ahora pueden emplear una herramienta llamada Sketch. Pueden dibujar un boceto rápido con el dedo directamente sobre una imagen en ChatGPT, añadir un breve comentario como "haz esto negro mate" y dejar que el modelo haga el resto. La pregunta era si esta precisión se mantendría en la producción comercial.

El fin del ingeniero de prompts

El fin del ingeniero de prompts
Foto: openai.com

Hasta esta semana, el diseño con IA era, a todos los efectos, una máquina tragamonedas. Si a un equipo de marketing le gustaba un personaje generado pero lo necesitaba de pie en una habitación diferente, volver a tirar de la palanca significaba arriesgar la identidad visual central del personaje. La creación de guiones gráficos y el prototipado de productos se estancaban porque el resultado era demasiado frágil para iterar sobre él.

Lo que más nos impresionó de GPT‑Image‑2.5 Flare es lo bien que entiende qué no debe cambiar. Puedes hacer una edición significativa sin perder el personaje, la composición o la identidad visual de la imagen original." — Axultan Alimkulov, Director de Producto en Higgsfield AI

OpenAI formalizó esta nueva estabilidad dividiendo su API en dos herramientas específicas. Los desarrolladores pueden elegir Flare para iteraciones rápidas y de gran volumen, o cambiar a Sunburst para una generación comercial premium más lenta, donde un control impecable de los píxeles es obligatorio. Esta estructura permite a los creadores empresariales establecer flujos de trabajo fiables que no se degradan después de cinco o seis revisiones. La capacidad es tan robusta que los competidores tradicionales la están absorbiendo en lugar de combatirla. Adobe ya está integrando estos modelos de GPT Image 2.5 directamente en su flujo de trabajo de Firefly. El siguiente obstáculo es lograr que la capa final del diseño, el texto en sí, sea igual de obediente.

Lo que queda por resolver

Aunque la fidelidad visual de Images 2.5 es un problema resuelto para la mayoría de los usuarios, la tipografía sigue siendo un desafío persistente. La generación de texto está mejorando, pero no es perfectamente autónoma. Para evitar que las oraciones largas se degraden y se conviertan en un galimatías, los usuarios todavía tienen que emplear trucos estrictos de formato, como usar comillas exactas y nombrar explícitamente la jerarquía tipográfica en sus prompts.

La verdadera iteración de alta fidelidad también conlleva un costo informático. Para obtener las ediciones de múltiples rondas más limpias posibles y sin artefactos, los desarrolladores deben usar el modelo más pesado Sunburst. Esto sacrifica la velocidad de generación para asegurar el control sin errores que requieren las campañas de alto nivel.

Estas son concesiones prácticas para un sistema que ha cambiado permanentemente la base del trabajo visual. Cualquiera que tenga una idea ahora puede comenzar con una foto de referencia, fijar el parecido de un personaje e iterar con confianza a lo largo de una extensa conversación de ida y vuelta. La era de tirar de la palanca de una máquina tragamonedas y rezar por los píxeles correctos ha terminado. Los diseñadores por fin tienen un volante.

Images 2.5 Solves the Second Prompt

A visual summary of this story

The Brief

Mantén la curiosidad

IA y tecnología: qué cambia y por qué importa.
Tu selección diaria, en inglés o español.

Gratis para siempre. Cancela cuando quieras.

Conversación

Inicia la conversación

No necesitas cuenta. Los comentarios se revisan automáticamente: mantén el respeto.

Más historias

Seguir leyendo