GPT Image 2
O modelo de geração de imagens mais avançado da OpenAI — qualidade fotorrealista, texto renderizado quase sem erros e obediência exemplar às instruções. Lançado em 21 de abril de 2026. A mesma IA por trás do ChatGPT Images 2.0.
exemplos





O que é o GPT Image 2?
O GPT Image 2 (nome oficial na API: gpt-image-2) foi lançado pela OpenAI em 21 de abril de 2026 como ChatGPT Images 2.0 — o sucessor direto do GPT Image 1.5 (dezembro de 2025). É o maior salto da família GPT Image e, com a aposentadoria programada do DALL-E 2 e do DALL-E 3 em maio de 2026, passa a ser a única plataforma de geração de imagens da OpenAI daqui em diante.
O grande destaque não é só a qualidade da imagem — é o raciocínio. O GPT Image 2 é o primeiro modelo de imagem da OpenAI com capacidade nativa de "pensar": no modo Thinking, ele planeja a composição, pesquisa na web referências do mundo real e revisa o próprio resultado antes de finalizar. A OpenAI o descreve como um "parceiro de pensamento visual" criado para fluxos de trabalho profissionais.
O que há de novo no GPT Image 2?
Em relação ao GPT Image 1.5, o GPT Image 2 traz:
- Raciocínio nativo (modo Thinking): o modelo planeja antes de desenhar — uma estreia entre os modelos de imagem da OpenAI. Ele define o layout, pesquisa na web e depois confere o resultado.
- Resolução nativa 2K (2048px): elimina a etapa de upscaling que prejudicava a qualidade nos fluxos anteriores.
- Texto quase perfeito: 19 de 20 prompts com muito texto geram texto legível na primeira tentativa (testes práticos da PixVerse). Agora também em japonês, coreano, chinês, hindi e bengali.
- Qualquer proporção (de 3:1 a 1:3): de banners ultralargos a telas de celular bem altas — sem formatos fixos.
- Lote com várias imagens (até 8): gere uma tirinha, um storyboard ou uma campanha inteira com personagens consistentes a partir de um único prompt (modo Thinking).
GPT Image 2 vs. modelos anteriores da OpenAI
O DALL-E 2 e o DALL-E 3 foram aposentados em 12 de maio de 2026. Agora o GPT Image 2 é a única plataforma de geração de imagens da OpenAI.
| Recurso | DALL-E 3 | GPT Image 1/1.5 | GPT Image 2 ✦ |
|---|---|---|---|
| Raciocínio nativo / Thinking | ✗ | ✗ | ✓ Pela primeira vez |
| Resolução máxima | 1024px | 1536px | 2048px (2K) |
| Precisão do texto | Fraca | Moderada | Quase perfeita (19/20) |
| Texto em CJK / hindi / bengali | ✗ | Limitado | ✓ Caracteres precisos |
| Variedade de proporções | Formatos fixos | Formatos fixos | 3:1 → 1:3 (qualquer) |
| Lote com várias imagens | ✗ | ✗ | Até 8 (Thinking) |
| Pesquisa na web durante a geração | ✗ | ✗ | ✓ (modo Thinking) |
| Edição de imagens | ✗ | ✓ (1.5) | ✓ Avançada |
| Fundo transparente | ✓ | ✓ | ✗ Não suportado |
| Metadados de procedência C2PA | ✗ | Parcial | ✓ Em todas as imagens |
Principais recursos
Modo Thinking nativo
O primeiro modelo de imagem da OpenAI com raciocínio. Planeja a composição, busca referências na web e confere o resultado antes de finalizar — o que aumenta muito o acerto de primeira em prompts complexos.

Texto preciso nas imagens
19 de 20 gerações com muito texto saem legíveis na primeira tentativa (testes da PixVerse). Dá conta de títulos em várias linhas, alfabetos não latinos, layouts em mais de um idioma e textos densos de interface.

Resultado fotorrealista
Reproduz textura de pele, reflexo dos materiais, granulação, profundidade de campo e as pequenas imperfeições da luz. O Canva definiu assim: "raciocínio criativo e bom gosto em design — essa virada acabou de acontecer."

Resolução 2K e qualquer proporção
Saída nativa em 2048px. Aceita qualquer proporção, de 3:1 ultralarga (banners) a 1:3 ultra-alta (telas de celular) — sem a etapa de upscaling que prejudicava a qualidade nos fluxos anteriores.

Geração em lote de várias imagens
Gere até 8 imagens coerentes a partir de um único prompt, com personagens consistentes em todo o lote (modo Thinking). Um prompt → uma tirinha, um storyboard ou uma campanha completa.

Procedência C2PA e segurança
Toda imagem do GPT Image 2 traz metadados C2PA — uma prova verificável por máquina de que a imagem foi gerada por IA. A moderação de conteúdo é rigorosa, mas deixa bastante espaço para a criatividade.

Guia de prompts do GPT Image 2
Prompts que funcionam muito bem, organizados por categoria. Copie qualquer um e cole no gerador à esquerda.
Retrato cinematográfico
Pôster e design com muito texto
Personagens e design de interface
Infográficos e experimentais
A fórmula do prompt
Escreva como um diretor orientando um fotógrafo. Coloque os detalhes mais importantes nas primeiras 50 palavras.
[Estilo/Meio] + [Tema] + [Cenário] + [Iluminação] + [Composição] + [Especificações técnicas]
Quem usa o GPT Image 2 e por quê
E-commerce e equipes de produto
Crie imagens de destaque, fotos lifestyle e fotos de produto com fundo sem precisar de estúdio. Com o fotorrealismo do GPT Image 2, as imagens podem ir direto para anúncios na Shopify ou páginas de produto na Amazon.
Social media
Crie visuais únicos e alinhados à marca em grande escala. Como o texto sai preciso, dá para gerar artes de post já com o texto aplicado — algo em que a maioria dos modelos de IA falha.
Escritores e autores
Crie artes de capa, imagens de referência de personagens, visualizações de cenas e capas de livro. Em muitos casos, a qualidade dos retratos rivaliza com ilustrações encomendadas.
Arquitetos e designers
Visualize conceitos de interiores, combinações de materiais e layouts de espaços antes de partir para a execução. Ideação rápida por uma fração do custo de uma renderização 3D.
Educadores e pesquisadores
Crie diagramas ilustrados, reconstituições de cenas históricas e materiais visuais de ensino. Laboratórios de pesquisa usam o GPT Image 2 para estudar conteúdo gerado por IA em grande escala.
Marketing e equipes de marca
Visualize conceitos de campanha rapidamente. Gere várias direções criativas em minutos, apresente aos stakeholders e invista só nas ideias mais fortes.
O GPT Image 2 na pesquisa acadêmica
Arxiv · 2604.25213 · abril de 2026
When the Forger Is the Judge: GPT-Image-2 Cannot Recognize Its Own Faked Documents
Este estudo mostra a capacidade do GPT Image 2 de gerar documentos fotorrealistas — tão realistas que o próprio modelo não consegue identificá-los como gerados por IA. A pesquisa evidencia o fotorrealismo sem precedentes do modelo e levanta questões importantes sobre a autenticação de documentos.
Arxiv · 2604.25370 · abril de 2026
GPT-Image-2 in the Wild: A Twitter Dataset of Self-Reported AI-Generated Images from the First Week of Deployment
Pesquisadores coletaram e analisaram milhares de imagens compartilhadas publicamente no Twitter na primeira semana após o lançamento do GPT Image 2. O conjunto de dados documenta padrões de uso reais, as categorias criativas mais populares e como o conteúdo gerado por IA se espalha pelas redes sociais.
Perguntas frequentes
O GPT Image 2 (nome oficial na API: gpt-image-2, também divulgado como ChatGPT Images 2.0) é o modelo de geração de imagens mais avançado da OpenAI, lançado em 21 de abril de 2026. É o sucessor direto do GPT Image 1.5 (dezembro de 2025) e, com a aposentadoria do DALL-E 2 e do DALL-E 3 em maio de 2026, é a única plataforma de geração de imagens da OpenAI. É também o primeiro modelo de imagem da OpenAI com capacidade nativa de "pensar" — ele planeja, pesquisa na web e revisa o resultado antes de finalizar a imagem.
O GPT Image 2 tem dois modos. O modo Instant — disponível para todos os usuários, inclusive no plano gratuito — traz as principais melhorias de qualidade: resolução 2K, texto preciso e fotorrealismo. O modo Thinking (disponível para assinantes do ChatGPT Plus, Pro, Business e Enterprise) libera a camada de raciocínio: o modelo planeja a composição, busca na web referências visuais do mundo real, gera até 8 imagens coerentes em um só lote com personagens consistentes e confere o resultado antes de finalizar. Para a maioria das necessidades de uma única imagem, o modo Instant é suficiente.
Não — e o DALL-E 3 inclusive já foi aposentado (12 de maio de 2026). O GPT Image 2 é uma arquitetura totalmente nova da OpenAI, não uma atualização do DALL-E. As principais diferenças: o GPT Image 2 gera até 2K (2048px), contra 1024px do DALL-E 3; renderiza texto quase perfeitamente, enquanto o DALL-E 3 não era confiável nisso; aceita qualquer proporção de 3:1 a 1:3; e é o primeiro modelo de imagem com raciocínio nativo.
Não — o gpt-image-2 não oferece fundo transparente (PNG com canal alfa). Se você precisa de recortes sem fundo, use o GPT Image 1 ou 1.5, ou faça o pós-processamento no Photoshop/Figma. Para fotos de produto com fundo branco, peça no prompt "on a pure white background, studio lighting".
Cada geração com o GPT Image 2 custa 5 créditos. O custo maior reflete o processamento mais pesado do GPT Image 2 em comparação com modelos mais simples — a inferência é bem mais complexa, principalmente nas saídas de alta qualidade. Você pode comprar mais créditos na nossa página de preços.
Muito superior à de qualquer modelo de imagem anterior da OpenAI. Nos testes práticos da PixVerse com 14 prompts de pôsteres e tipografia, 19 de 20 gerações com muito texto saíram com texto legível e escrito corretamente na primeira tentativa. O modelo lida com o alfabeto latino quase sem erros em resolução 2K e alcança precisão em nível de caractere em escritas não latinas, como japonês, coreano, chinês, hindi e bengali.
A reprodução de logotipos de marcas não é confiável. A geração é mais lenta que a de modelos leves como o FLUX Schnell. Não há suporte a fundo transparente. A política de conteúdo é mais rígida que a de alternativas open source. Tarefas complexas do mundo físico (passo a passo de origami, diagramas de cubo mágico, superfícies espelhadas ou inclinadas) ainda podem dar errado. Detalhes finos muito densos ou repetitivos podem perder a coerência.
Escreva como um diretor orientando um fotógrafo. Use a fórmula: [Estilo/Meio] + [Tema] + [Cenário] + [Iluminação] + [Composição] + [Especificações técnicas]. Coloque os detalhes mais importantes nas primeiras 50 palavras. Indique a proporção explicitamente ("aspect ratio 9:16"). Para garantir a precisão do texto, acrescente "All text must be fully accurate" no final.
Também conhecido como