Claude Opus 4.8 è già qui: 41 giorni dopo il precedente, con flussi di lavoro paralleli e nuovi benchmark

Condividi:
Facebook
X
Telegram
Threads
WhatsApp

Quarantuno giorni. È il tempo trascorso tra il rilascio di Claude Opus 4.7 e quello di Opus 4.8, avvenuto il 28 maggio 2026. Non è mai successo prima a questo ritmo, nella storia pubblica di Anthropic. I modelli Sonnet e Haiku, per confronto, aspettano rispettivamente tre e sette mesi tra un’iterazione e l’altra.

Il motivo del passo accelerato non è difficile da leggere: Opus 4.7 aveva convinto poco, con una ricezione tiepida da parte degli sviluppatori che si aspettavano di più dall’aggiornamento flagship della serie. Nello stesso periodo, OpenAI ha rilasciato Codex e Google ha spinto Gemini Flash, alzando il livello di pressione competitiva. Anthropic ha risposto accelerando.

Il risultato è Claude Opus 4.8 — disponibile da subito su API, Amazon Bedrock, Google Cloud Vertex AI e Microsoft Foundry, allo stesso prezzo del predecessore.

Il cambiamento più importante non è nei benchmark

Anthropic inquadra Opus 4.8 con una frase precisa: “sharper judgement, more honesty about its progress, and the ability to work independently for longer.” Il punto centrale non è la velocità, né il punteggio su un benchmark specifico. È l’affidabilità operativa.

Il modello è circa quattro volte meno propenso di Opus 4.7 a lasciare passare senza segnalarlo un errore nel codice che ha scritto. Concretamente: meno messaggi del tipo “implementato e testato” che risultano sbagliati al momento della code review. Bridgewater Associates, tra i tester anticipati, ha descritto un comportamento preciso — il modello segnalava autonomamente problemi sia negli input che negli output di un’analisi finanziaria, qualcosa che le versioni precedenti, e i modelli concorrenti, sistematicamente mancavano.

Il team di allineamento interno di Anthropic riporta che Opus 4.8 raggiunge i valori più alti mai registrati sui suoi parametri di “prosocial traits” — tendenza a supportare l’autonomia dell’utente, agire nel suo interesse, non ingannare. I tassi di comportamento disallineato, come la tendenza alla deception, risultano vicini a quelli di Claude Mythos Preview, il modello di nuova generazione non ancora disponibile al pubblico.

Benchmark: sei vinti su sette, uno perso

I numeri quantificano i miglioramenti su coding, ragionamento scientifico e uso del computer in modo autonomo. Su SWE-Bench Pro — il benchmark più rilevante per ingegneri software, costruito su repository open-source reali — Opus 4.8 segna 69,2% contro il 64,3% di Opus 4.7. Il vantaggio su GPT-5.5 è di oltre 10 punti percentuali (58,6%), quello su Gemini 3.1 Pro di 15 punti (54,2%).

Su GDPval-AA, che misura il valore economico reale delle risposte, Opus 4.8 apre a 1.890 Elo — 121 punti sopra GPT-5.5 — una distanza che si traduce in un win rate implicito del 67% nei confronti testa a testa. Su OSWorld, che valuta l’uso autonomo del computer, segna 83,4% contro il 78,7% di GPT-5.5. Su GPQA Diamond, il ragionamento scientifico a livello universitario, raggiunge il 93,6%.

C’è un’eccezione che vale la pena nominare: Terminal-Bench 2.1, che misura workflow complessi da riga di comando con pianificazione iterativa e gestione degli errori. Lì GPT-5.5 vince ancora, con 78,2% contro 74,6%. Il gap si è ridotto rispetto a Opus 4.7, ma non è chiuso. Chi usa Claude principalmente in contesti da terminale, con tool chaining intensivo, ha ancora una ragione per confrontare le due opzioni.

Dynamic Workflows: fino a mille agenti in parallelo

La novità di piattaforma più rilevante arriva con Claude Code v2.1.154 e si chiama Dynamic Workflows, disponibile in research preview. Il meccanismo è diverso da quello dei subagent tradizionali e la differenza è tecnica, non cosmtica.

Con i subagent classici, il piano di esecuzione di Claude rimane nel context window del modello. Con i Dynamic Workflows, Claude scrive uno script JavaScript che orchestra i subagent necessari per il task. Il runtime esegue quello script in background. I risultati intermedi vivono nelle variabili dello script, non nel context di Claude, che riceve solo il risultato finale. La sessione rimane responsiva mentre il lavoro avviene in parallelo.

Il sistema può coordinare fino a 1.000 subagent in una singola run. Anthropic ha dimostrato la capacità su codebase da oltre 750.000 righe di Rust. I run interrotti si riprendono dal checkpoint — non ricominciano da zero. Questo cambia la praticabilità di task molto lunghi, che fino ad oggi rischiavano di essere persi in caso di interruzione.

Il caveat da tenere a mente: ogni subagent consuma token, e a 1.000 agenti i costi scalano velocemente. Dynamic Workflows non è uno strumento per risparmiare, è uno strumento per fare cose che prima non erano fattibili. Chi lo usa in produzione deve misurare il consumo di token prima di automatizzare run di grandi dimensioni.

Effort Control e Messages API

Insieme al modello, Anthropic ha reso disponibile l’Effort Control su tutti i piani di claude.ai e su Cowork. L’utente può scegliere quanto sforzo computazionale — e quindi quanti token — dedicare a una risposta. Il default è “high”, il livello precedente standard. Sopra ci sono “extra” (indicato come “xhigh” in Claude Code) e “max”. Michael Truell, co-fondatore di Cursor, ha commentato che Opus 4.8 “supera i precedenti Opus su CursorBench a tutti i livelli di effort”, con chiamate agli strumenti più efficienti e maggiore capacità di portare a termine task lunghi.

Sul fronte API, un aggiornamento consente ora di inserire system entry direttamente nell’array messages. Per i team che costruiscono pipeline agentiche complesse, questo significa poter aggiornare le istruzioni del modello a metà sessione — permessi, token budgets, context ambientale — senza rompere la cache del prompt o dover passare attraverso un turno utente.

Prezzi e prossimi passi

Il prezzo standard di Opus 4.8 resta invariato rispetto a Opus 4.7: 5 dollari per milione di token in input, 25 in output. Il Fast mode — che offre velocità 2,5 volte superiore — è sceso a 10 dollari per milione di token in input e 50 in output, circa un terzo del costo che aveva sulle versioni precedenti di Opus. Una riduzione di prezzo reale, annunciata come feature di lancio.

Claude Mythos Preview, la classe di modelli successiva nella roadmap di Anthropic, resta non ancora disponibile al pubblico. L’azienda ha confermato che i modelli Mythos-class arriveranno “nelle prossime settimane”, ma che richiedono salvaguardie aggiuntive prima di un rilascio esteso — includono capacità progettate specificamente per contesti di cybersecurity che giustificano procedure di verifica più lunghe.


FONTI

  1. TechCrunch — Anthropic releases Opus 4.8 with new ‘dynamic workflow’ tool

Per rimanere aggiornato sulle novità e sulle offerte del mondo della tecnologia, seguici su Telegram e Whatsapp

Articoli correlati

Il riquadro giallo in chat dice che il codice di sicurezza con quel contatto è cambiato. Non dice che qualcuno...

Disney+ ha inviato agli abbonati italiani una mail sulle nuove Condizioni generali. Entrano in vigore trenta giorni dopo l’avviso. Non...

Matteo Del Fante ha detto la frase che chiude la parte di Borsa e apre quella da organigramma. Al TG...

Oggi, lunedì 14 settembre, Apple apre il rubinetto di iOS 27, iPadOS 27, watchOS 27, tvOS 27, visionOS 27 e...

WhatsApp sta allargando alle chiamate quello che ha già fatto con le chat da ospite: far entrare chi non ha...

Samsung Display sta per dare alla serie Galaxy S il primo cambio serio di materiale OLED in tre anni. Secondo...