OpenAI lanza ChatGPT Images 2.0, un sistema de generación de imágenes con capacidades de razonamiento
Un poco más de un año después de que OpenAI diera a los usuarios de ChatGPT la opción de crear imágenes y diseños directamente desde su chatbot, ahora está lanzando ChatGPT Images 2.0. OpenAI describe el nuevo sistema como un “cambio de paso” para los modelos de generación de imágenes, particularmente cuando se trata de la capacidad de la herramienta para seguir instrucciones en detalle, renderizar texto denso y colocar y relacionar objetos en una escena. Por primera vez, OpenAI ha construido un modelo de imagen con capacidades de razonamiento, lo que le da al sistema la capacidad de hacer cosas como buscar en la web y verificar sus resultados. Según la empresa, esas capacidades deberían traducirse en una herramienta más fiable cuando la precisión, la coherencia y la cohesión visual son esenciales.
OpenAI afirma que también ha trabajado mucho para hacer que Images 2.0 sea mejor para entender y renderizar texto no latino, con “ganancias significativas” cuando se trata de la capacidad del modelo para manejar japonés, coreano, chino, hindi y bengalí. Al mismo tiempo, la empresa afirma que el nuevo modelo es mejor para recrear fielmente las características específicas de diferentes lenguajes visuales. En este punto, OpenAI dice que eso hace que Images 2.0 sea más útil para tareas como la creación de prototipos de juegos y la creación de storyboards. Fuera de esas características, el nuevo modelo es más flexible cuando se trata de relaciones de aspecto, lo que le permite generar imágenes que son tan anchas como 3:1 y tan altas como 1:3. También puede producir diseños en resoluciones de hasta 2K y incluso generar hasta ocho resultados en una sola pasada.
Pruebas con ChatGPT Images 2.0
Tuve la oportunidad de probar Images 2.0 antes de su lanzamiento público. Para mi primera prueba, le pedí a ChatGPT que generara una imagen de un gato de concha de tortuga en el estilo de arte de píxeles de la tercera generación de Pokémon. Pensé que esto sería una buena prueba porque los modelos de inteligencia artificial suelen tener dificultades con el arte de píxeles, y los juegos de Pokémon para Game Boy Advance son icónicos por su estilo de arte, así que si ChatGPT apenas aproximaba ese estilo, no sería suficiente. El resultado es la imagen que se ve arriba, y creo que ChatGPT hizo un trabajo commendable allí. Luego, le pedí al nuevo modelo que convirtiera esa imagen en una PNG transparente. Para una última prueba, le pedí a ChatGPT que creara un manga de cuatro páginas sobre mi gato disfrutando de un día soleado junto a un arroyo de la ciudad idílica.
De esas tres pruebas, ChatGPT dedicó más tiempo a la segunda y la salida allí fue ligeramente diferente a la primera imagen que generó, lo que sentí que se desviaba de mi instrucción. Sin embargo, logró generar una imagen transparente adecuada, lo que es algo que otros modelos de imagen pueden tener dificultades para hacer correctamente. Una vez que más personas tengan la oportunidad de probar el modelo, tendremos una mejor idea de cómo se compara con Nano Banana 2 de Google y dónde OpenAI puede hacer mejoras adicionales.
Disponibilidad y características
Images 2.0 está disponible a partir de hoy para todos los usuarios de ChatGPT, incluidos aquellos en los niveles Free y Go de la empresa. Los suscriptores de Plus y Pro tienen acceso a salidas más avanzadas. OpenAI también está haciendo que el modelo esté disponible a través de su servicio de API y la aplicación de codificación Codex, que apenas la semana pasada actualizó para ofrecer generación de imágenes integrada. Cabe destacar que Images 2.0 llega justo días después de que Anthropic entrara en el mercado de diseño visual con su propio asistente de diseño.

