OpenAI ha annunciato ieri, 21 aprile 2026, il lancio ufficiale di ChatGPT Images 2.0, il nuovo sistema di generazione visiva basato sul modello gpt-image-2. Disponibile da subito per tutti gli utenti di ChatGPT e Codex — incluso il piano gratuito — segna un cambiamento di paradigma: per la prima volta, un modello di immagini di OpenAI incorpora capacità di ragionamento native, può effettuare ricerche sul web e verifica i propri output prima di consegnarli. Il risultato, almeno sulla carta, è la transizione da un generatore di immagini a quello che l’azienda definisce un “partner visivo per il pensiero”.
Perché ChatGPT Images 2.0 è diverso da tutto ciò che è venuto prima
Il problema storico di tutti i modelli di generazione visiva è sempre stato lo stesso: il testo nelle immagini. Parole storpiate, lettere inventate, tipografia illeggibile. Chiunque abbia provato a generare un menu, un’infografica o una slide con strumenti AI negli ultimi anni lo sa bene.
Con Images 2.0, OpenAI sostiene di aver risolto il problema alla radice. L’architettura è stata, secondo il Research Lead Boyuan Chen, “rivista da zero”. Il testo — anche denso, anche in alfabeti non latini — viene ora renderizzato con una precisione che le versioni precedenti non avrebbero nemmeno avvicinato. Giapponese, coreano, cinese, hindi, bengali: OpenAI dichiara progressi significativi su tutte queste lingue, con una comprensione approfondita delle specificità visive di ciascun sistema di scrittura.
Ma il salto vero non è solo nella qualità del testo. È nel modo in cui il modello lavora.
Modalità Instant e Thinking: due velocità, un unico modello
ChatGPT Images 2.0 opera in due modalità distinte.
La modalità Instant è quella disponibile per tutti — piano gratuito incluso. Genera immagini rapidamente, con una qualità di base nettamente superiore rispetto al predecessore gpt-image-1.5. È la modalità pensata per chi ha bisogno di un output rapido senza particolari esigenze di controllo sul processo creativo.
La modalità Thinking è un’altra cosa. Riservata agli abbonati ai piani Plus, Pro e Business, questa modalità introduce capacità di ragionamento native: il modello pianifica la composizione prima di renderizzarla, conta gli oggetti, verifica i vincoli del prompt, effettua ricerche web in tempo reale per garantire accuratezza visiva. In Thinking mode, ChatGPT Images 2.0 può generare fino a otto immagini da un singolo prompt, mantenendo coerenza di personaggi, oggetti e stile attraverso tutta la serie.
Una scelta editoriale interessante quella di OpenAI: non gettare la qualità base dietro un paywall, ma alzare la qualità per tutti e riservare il ragionamento avanzato agli abbonati. Funziona come messaggio di mercato, ma chi ha bisogno davvero delle funzioni più potenti dovrà mettere mano al portafoglio.
Cosa ci si può fare concretamente
I casi d’uso dichiarati da OpenAI coprono un territorio ampio. Infografiche complete, layout editoriali stile rivista, storyboard per campagne pubblicitarie, character sheet per game design, fumetti a più scene, mappe geografiche con legende leggibili, piani architettonici. Tutto da un singolo prompt, senza dover intervenire manualmente sulla post-produzione.
Per i creativi che lavorano su contenuti serializzati — sequenze manga, campagne social con identità visiva coerente, libri illustrati — la generazione multipla con continuità visiva è probabilmente la funzione più interessante. Eliminare il “prompt uno alla volta, poi cuci a mano” è un risparmio di tempo concreto.
Altrettanto rilevante, per chi lavora su mercati internazionali, è il supporto multilingua per testi non latini. Localizzare materiali grafici per mercati asiatici senza post-produzione manuale era, fino a ieri, un’operazione complessa. Ora, almeno in teoria, il modello gestisce il testo localmente nel prompt.
Risoluzione, formati e accesso API
Sul fronte tecnico: risoluzione fino a 2K via ChatGPT e fino a 4K via API (ancora in beta, con possibili risultati inconsistenti). Rapporti d’aspetto da 3:1 a 1:3 — banner, schermate mobile, slide, poster verticali: ogni formato è coperto.
Per gli sviluppatori, il modello è accessibile tramite API con il nome gpt-image-2. Il pricing segue una logica a token, non a immagine flat: 8 dollari per milione di token di input immagine, 30 dollari per milione di token di output immagine; 5 e 10 dollari rispettivamente per i token di testo. A risoluzione standard 1024×1024 in alta qualità, il costo si aggira intorno ai 21 centesimi di dollaro per immagine — sensibilmente più alto rispetto al modello precedente, ma giustificato dall’aggiunta del reasoning step. La modalità Thinking aggiunge token per il ragionamento, quindi i costi reali su prompt complessi vanno modellati caso per caso.
Il modello è integrato anche in Codex, l’ambiente di sviluppo di OpenAI, permettendo la generazione visiva direttamente nello stesso spazio di lavoro usato per il codice, le slide e altri deliverable.
Il contesto competitivo: Google, Anthropic e la corsa al testo nelle immagini
Questo lancio non avviene nel vuoto. A febbraio 2026, Google aveva rilasciato Nano Banana 2 — conosciuto anche come Gemini 3 Pro Image — con funzionalità simili di testo integrato nelle immagini. Anthropic, nel frattempo, ha presentato Claude Design, il proprio assistente visivo. Il mercato della generazione visiva si è affollato rapidamente, e la posta in gioco non è più la qualità fotografica generica ma la capacità di produrre asset direttamente utilizzabili in contesti professionali: infografiche, UI mockup, materiali editoriali, advertising.
OpenAI decide di rispondere con un modello che, almeno secondo le prime prove di giornalisti e tester, regge il confronto — e in alcuni casi lo vince. I risultati su mappe geografiche dettagliate, screenshot di interfacce e composizioni tipografiche dense sembrano effettivamente superiori a quelli del diretto concorrente di Google, secondo i test pubblicati da VentureBeat.
Il vero limite: la disinformazione visiva
C’è però un rovescio della medaglia che va messo in chiaro, senza ipocrisie.
Un modello in grado di generare screenshot d’interfaccia praticamente indistinguibili dagli originali, articoli di giornale con layout verosimili, post sui social con timestamp realistici e avatar convincenti — è anche lo strumento di disinformazione visiva più potente mai messo a disposizione del pubblico su larga scala. OpenAI dichiara di aver implementato salvaguardie, inclusi metadati C2PA e watermarking. Ma la stessa Adele Li, dell’azienda, ha ammesso in conferenza stampa che i metadati “non sono una soluzione definitiva”: bastano uno screenshot e un ritaglio per far sparire qualsiasi traccia.
Il dibattito è aperto, e le risposte non sono ancora arrivate. Quello che è certo è che il modello è già nell’API — e quindi nelle mani degli sviluppatori.
Una nuova soglia per la produzione visiva AI
ChatGPT Images 2.0 sposta concretamente l’asticella. Il testo nelle immagini, problema irrisolto per anni, è finalmente gestito a un livello che permette output direttamente pubblicabili. La modalità Thinking porta la generazione visiva dentro il territorio del ragionamento, trasformando il modello da strumento di ideazione a componente di una pipeline produttiva reale.
Per grafici, content creator, sviluppatori e team marketing che già lavorano nell’ecosistema OpenAI, l’aggiornamento è sostanziale. Per chi valuta soluzioni AI per la produzione visiva professionale, questo è il momento di testarlo con casi d’uso concreti — e di costruire quella modellazione dei costi che, con il pricing a token, diventa indispensabile prima di un deployment in produzione.
Il modello è disponibile da oggi per tutti. La domanda da porsi non è se usarlo, ma come farlo in modo responsabile.
Fonti:
TechCrunch — https://techcrunch.com/2026/04/21/chatgpts-new-images-2-0-model-is-surprisingly-good-at-generating-text/ VentureBeat — https://venturebeat.com/technology/openais-chatgpt-images-2-0-is-here-and-it-does-multilingual-text-full-infographics-slides-maps-even-manga-seemingly-flawlessly OpenAI Blog — https://openai.com/index/introducing-chatgpt-images-2-0/ The Decoder — https://the-decoder.com/openais-chatgpt-images-2-0-thinks-before-it-generates-adding-reasoning-and-web-search-to-image-creation/ Tuttotech.net — https://www.tuttotech.net/news/2026/04/21/ufficiale-chatgpt-images-2-testi-immagini-ai-perfetti.html PetaPixel — https://petapixel.com/2026/04/21/openai-claims-chatgpt-images-2-0-can-think/