GPT Image 2
El modelo de generación de imágenes más potente de OpenAI: calidad fotorrealista, texto casi perfecto y un seguimiento de instrucciones de primer nivel. Lanzado el 21 de abril de 2026. La misma IA que impulsa ChatGPT Images 2.0.
ejemplos





¿Qué es GPT Image 2?
GPT Image 2 (nombre oficial en la API: gpt-image-2) fue lanzado por OpenAI el 21 de abril de 2026 como ChatGPT Images 2.0, sucesor directo de GPT Image 1.5 (diciembre de 2025). Es el mayor salto de la familia GPT Image y, con la retirada programada de DALL-E 2 y DALL-E 3 en mayo de 2026, la única plataforma de generación de imágenes de OpenAI de aquí en adelante.
La gran novedad no es solo la calidad de imagen, sino el razonamiento. GPT Image 2 es el primer modelo de imagen de OpenAI con capacidad nativa de "pensar": en el modo Thinking planifica la composición, busca referencias reales en la web y revisa su propio resultado antes de darlo por terminado. OpenAI lo describe como un "compañero de pensamiento visual" pensado para flujos de trabajo profesionales.
¿Qué hay de nuevo en GPT Image 2?
Frente a GPT Image 1.5, GPT Image 2 incorpora:
- Razonamiento nativo (modo Thinking): el modelo planifica antes de dibujar, algo inédito en un modelo de imagen de OpenAI. Organiza la composición, busca en la web y luego verifica su propio resultado.
- Resolución nativa 2K (2048px): elimina el paso de reescalado que degradaba la calidad en flujos anteriores.
- Texto casi perfecto: 19 de cada 20 prompts con mucho texto devuelven texto legible al primer intento (pruebas prácticas de PixVerse). Ahora también maneja japonés, coreano, chino, hindi y bengalí.
- Cualquier relación de aspecto (de 3:1 a 1:3): desde banners ultrapanorámicos hasta pantallas móviles verticales, sin formatos fijos.
- Lotes de varias imágenes (hasta 8): genera un cómic completo, un storyboard o una campaña con personajes coherentes a partir de un solo prompt (modo Thinking).
GPT Image 2 frente a modelos anteriores de OpenAI
DALL-E 2 y DALL-E 3 se retiraron el 12 de mayo de 2026. GPT Image 2 es ahora la única plataforma de generación de imágenes de OpenAI.
| Función | DALL-E 3 | GPT Image 1/1.5 | GPT Image 2 ✦ |
|---|---|---|---|
| Razonamiento nativo / Thinking | ✗ | ✗ | ✓ El primero |
| Resolución máxima | 1024px | 1536px | 2048px (2K) |
| Precisión del texto | Deficiente | Moderada | Casi perfecta (19/20) |
| Texto CJK / hindi / bengalí | ✗ | Limitado | ✓ Preciso a nivel de carácter |
| Rango de relaciones de aspecto | Formatos fijos | Formatos fijos | 3:1 → 1:3 (cualquiera) |
| Lotes de varias imágenes | ✗ | ✗ | Hasta 8 (Thinking) |
| Búsqueda web durante la generación | ✗ | ✗ | ✓ (modo Thinking) |
| Edición de imágenes | ✗ | ✓ (1.5) | ✓ Avanzada |
| Fondo transparente | ✓ | ✓ | ✗ No compatible |
| Metadatos de procedencia C2PA | ✗ | Parcial | ✓ En todas las imágenes |
Funciones clave
Modo Thinking nativo
El primer modelo de imagen de OpenAI con razonamiento. Planifica la composición, busca referencias en la web y verifica su resultado antes de terminar, lo que dispara la tasa de acierto al primer intento con prompts complejos.

Texto preciso en las imágenes
19 de cada 20 generaciones con mucho texto salen legibles al primer intento (pruebas de PixVerse). Maneja titulares de varias líneas, alfabetos no latinos, composiciones en varios idiomas y textos de interfaz densos.

Resultados fotorrealistas
Reproduce la textura de la piel, el reflejo de los materiales, el grano, la profundidad de campo y sutiles imperfecciones de la luz. Canva lo resumió así: "razonamiento creativo y gusto por el diseño: ese cambio acaba de ocurrir".

Resolución 2K y cualquier relación de aspecto
Salida nativa de 2048px. Admite cualquier relación de aspecto, desde 3:1 ultrapanorámico (banners) hasta 1:3 ultravertical (pantallas móviles), sin el reescalado que degradaba la calidad en flujos anteriores.

Generación por lotes de varias imágenes
Genera hasta 8 imágenes coherentes a partir de un solo prompt, con personajes consistentes en todo el lote (modo Thinking). Un prompt → un cómic, un storyboard o una campaña completos.

Procedencia C2PA y seguridad
Cada imagen de GPT Image 2 incluye metadatos C2PA, una prueba verificable por máquina de que fue generada por IA. La moderación de contenido es estricta, pero permite un amplio uso creativo.

Guía de prompts para GPT Image 2
Prompts de alto rendimiento organizados por categoría. Copia cualquiera y pégalo en el generador de la izquierda.
Retrato cinematográfico
Póster y diseño con mucho texto
Diseño de personajes y UI
Infografía y experimental
La fórmula del prompt
Escribe como un director que da indicaciones a un fotógrafo. Pon los detalles clave en las primeras 50 palabras.
[Estilo/Técnica] + [Sujeto] + [Escenario] + [Iluminación] + [Composición] + [Especificaciones técnicas]
Quién usa GPT Image 2 y por qué
E-commerce y equipos de producto
Genera imágenes principales, fotos de estilo de vida y fotografía de producto con fondo sin necesidad de estudio. Gracias al fotorrealismo de GPT Image 2, los resultados pueden ir directos a fichas de Shopify o páginas de producto de Amazon.
Community managers
Crea visuales únicos y fieles a la marca a gran escala. Como el texto sale preciso, puedes generar gráficos para publicaciones con el copy superpuesto, algo en lo que fallan la mayoría de modelos de IA.
Escritores y autores
Genera ilustraciones de portada, imágenes de referencia de personajes, visualizaciones de escenas y portadas de libros. En muchos casos, la calidad de los retratos rivaliza con la de una ilustración por encargo.
Arquitectos y diseñadores
Visualiza conceptos de interiorismo, combinaciones de materiales y distribuciones espaciales antes de pasar a producción. Ideación rápida por una fracción de lo que cuesta un render 3D.
Docentes e investigadores
Crea diagramas ilustrados, reconstrucciones de escenas históricas y materiales didácticos visuales. Los laboratorios de investigación usan GPT Image 2 para estudiar el contenido generado por IA a gran escala.
Equipos de marketing y marca
Visualización rápida de conceptos para campañas. Genera varias direcciones creativas en minutos, preséntalas a los interesados e invierte solo en las ideas más fuertes.
GPT Image 2 en la investigación académica
Arxiv · 2604.25213 · abril de 2026
When the Forger Is the Judge: GPT-Image-2 Cannot Recognize Its Own Faked Documents
Este estudio demuestra la capacidad de GPT Image 2 para generar documentos fotorrealistas, tan realistas que el propio modelo no es capaz de detectarlos como generados por IA. La investigación pone de relieve el fotorrealismo sin precedentes del modelo y plantea preguntas importantes sobre la autenticación de documentos.
Arxiv · 2604.25370 · abril de 2026
GPT-Image-2 in the Wild: A Twitter Dataset of Self-Reported AI-Generated Images from the First Week of Deployment
Los investigadores recopilaron y analizaron miles de imágenes compartidas públicamente en Twitter durante la primera semana tras el lanzamiento de GPT Image 2. El conjunto de datos documenta patrones de uso reales, las categorías creativas más populares y la distribución del contenido generado por IA en las redes sociales.
Preguntas frecuentes
GPT Image 2 (nombre oficial en la API: gpt-image-2, también comercializado como ChatGPT Images 2.0) es el modelo de generación de imágenes más avanzado de OpenAI, lanzado el 21 de abril de 2026. Es el sucesor directo de GPT Image 1.5 (diciembre de 2025) y, tras la retirada de DALL-E 2 y DALL-E 3 en mayo de 2026, la única plataforma de generación de imágenes de OpenAI. Es el primer modelo de imagen de OpenAI con capacidad nativa de "pensar": planifica, busca en la web y se revisa a sí mismo antes de dar por terminada una imagen.
GPT Image 2 tiene dos modos. El modo Instant, disponible para todos los usuarios, incluido el plan gratuito, ofrece las mejoras de calidad principales: resolución 2K, texto preciso y fotorrealismo. El modo Thinking (para suscriptores de ChatGPT Plus, Pro, Business y Enterprise) activa la capa de razonamiento: el modelo planifica la composición, busca referencias visuales reales en la web, genera hasta 8 imágenes coherentes en un lote con personajes consistentes y verifica el resultado antes de terminar. Para la mayoría de necesidades de una sola imagen, el modo Instant es suficiente.
No, y de hecho DALL-E 3 ya se ha retirado (12 de mayo de 2026). GPT Image 2 es una arquitectura totalmente nueva de OpenAI, no una actualización de DALL-E. Las diferencias clave: GPT Image 2 genera hasta 2K (2048px) frente a los 1024px de DALL-E 3; reproduce el texto casi a la perfección, donde DALL-E 3 era poco fiable; admite cualquier relación de aspecto de 3:1 a 1:3; y es el primer modelo de imagen con razonamiento nativo.
No: gpt-image-2 no admite fondos transparentes (PNG con canal alfa). Si necesitas recortes sin fondo, tendrás que usar GPT Image 1 o 1.5, o retocar el resultado en Photoshop/Figma. Para fotografía de producto con fondo blanco, pide en el prompt "on a pure white background, studio lighting".
Cada generación con GPT Image 2 cuesta 5 créditos. El coste más alto refleja la carga computacional de GPT Image 2 frente a modelos más sencillos: ejecuta una inferencia mucho más compleja, sobre todo en calidad alta. Puedes recargar créditos en nuestra página de precios.
Mucho mejor que el de cualquier modelo de imagen anterior de OpenAI. En las pruebas prácticas de PixVerse con 14 prompts de pósteres y tipografía, 19 de 20 generaciones con mucho texto devolvieron un texto legible y bien escrito al primer intento. El modelo maneja los alfabetos latinos casi a la perfección en 2K y logra precisión a nivel de carácter en escrituras no latinas como el japonés, el coreano, el chino, el hindi y el bengalí.
Reproducir logotipos de marcas no es fiable. Genera más despacio que modelos ligeros como FLUX Schnell. No admite fondos transparentes. Su política de contenido es más estricta que la de las alternativas de código abierto. Las tareas complejas del mundo físico (pasos de origami, diagramas del cubo de Rubik, superficies invertidas o en ángulo) todavía pueden salir mal. Los detalles finos muy densos o repetitivos pueden perder coherencia.
Escribe como un director que da indicaciones a un fotógrafo. Usa la fórmula: [Estilo/Técnica] + [Sujeto] + [Escenario] + [Iluminación] + [Composición] + [Especificaciones técnicas]. Pon los detalles más importantes en las primeras 50 palabras. Indica la relación de aspecto de forma explícita ("aspect ratio 9:16"). Para que el texto salga exacto, añade al final "All text must be fully accurate".
También conocido como