News & Aggiornamenti7 min di letturaPubblicato il 2026-09-04

GPT-6 Astra: OpenAI spedisce il primo modello che si classifica da sola come critica sul cyber

Il 3 settembre 2026 OpenAI ha rilasciato GPT-6 Astra. Cosa fa davvero, perché il 99,9% su ARC-AGI-3 va letto con attenzione, quanto costa una volta contata la cache e perché la classificazione Critical sul cyber conta più dei benchmark.

In sintesi

Astra è il modello di punta di OpenAI, rilasciato il 3 settembre 2026 e orientato a computer use e browser use: si muove tra fogli, moduli e pagine web più veloce di una persona. Listino identico a Claude Fable 5.1, 10$ e 50$ per milione di token, ma la lettura della cache costa 1,00$ contro 0,25$ e sopra i 272.000 token di input le tariffe raddoppiano. Sui benchmark il quadro è misto: primo su matematica e automazione desktop, dietro su coding agentico e su Humanity's Last Exam con strumenti. La notizia vera è altrove: è il primo modello OpenAI a superare la soglia Critical del Preparedness Framework per capacità cyber offensive, e la catena di ragionamento è ora oscurata, cosa che complica la vita a chi deve documentare decisioni automatizzate.

Cosa ha rilasciato OpenAI il 3 settembre

Il modello si chiama Astra. Nella comunicazione e nell'identificativo API compare come GPT-6 Astra, e OpenAI lo presenta come salto generazionale rispetto alla linea GPT-5.6.

Il posizionamento è chiaro e non è il chatbot: Astra è un modello per l'uso del computer e del browser. Apre fogli, compila moduli, naviga tra le pagine, passa da un'applicazione all'altra. OpenAI dichiara flussi documentali completati con il 47% di tempo in meno rispetto a GPT-5.6 Sol, e sull'automazione desktop i numeri che ha pubblicato sono i migliori che abbia mai mostrato.

Gli altri due terreni rivendicati sono la matematica e la ricerca, con un 97,6% su FrontierMath Tier 4, e la cybersecurity difensiva. Su quest'ultimo punto si apre la parte interessante della storia, ma prima conviene guardare i numeri e il listino.

Una nota di metodo, perché conta: le pagine ufficiali di OpenAI da qui non sono raggiungibili in questo momento, quindi i valori riportati sotto arrivano dalle schede tecniche pubblicate dalla stampa e dagli aggregatori nelle ventiquattro ore successive al lancio. Dove le fonti divergono lo diciamo.

I numeri, e quanto valgono davvero

Il titolo che ha girato più di tutti è il 99,9% su ARC-AGI-3. È anche quello che va maneggiato con più cautela: quel punteggio arriva con una harness stateful, cioè un'impalcatura che mantiene lo stato tra i tentativi ed è costosa da far girare. Con chiamate API stateless, quelle che faresti tu in produzione, i risultati riportati scendono in una forbice molto più bassa, indicata tra il 17% e il 63% a seconda della fonte. Non è un dettaglio tecnico, è la differenza tra un annuncio e un preventivo.

Su FrontierMath Tier 4 il 97,6% è netto e su quel terreno Astra sta davanti a tutti. Su OSWorld 2.0, che misura l'uso del sistema operativo, si parla del 72,6% con circa quaranta minuti per compito contro i settantacinque della generazione precedente.

Sul codice il quadro si complica. Astra segna 74,1% su DeepSWE v1.1, con costi inferiori del 57% rispetto a GPT-5.6 Sol, ma su questo numero gli aggregatori non concordano e alcuni riportano valori più alti. E soprattutto SWE-Bench Pro, il benchmark di coding oggi più citato, non compare nella presentazione: OpenAI ha scelto di mostrare DeepSWE, quindi il confronto diretto con la generazione precedente e con la concorrenza sul coding non si può fare con i dati ufficiali.

Su Humanity's Last Exam con strumenti Astra resta dietro: 57,2% contro il 65,0% di Claude Fable 5.1. E l'Artificial Analysis Intelligence Index, che è un indice aggregato di terza parte e non un benchmark di parte, mette Astra a 61 contro il 66 di Fable 5.1.

Tradotto: non è un modello che vince su tutto. È un modello che vince molto dove OpenAI ha deciso di spingere, cioè l'automazione e la matematica.

Il prezzo è identico a Fable 5.1, finché non guardi la cache

Dieci dollari per milione di token in ingresso, cinquanta in uscita. Sono le stesse cifre di Claude Fable 5.1, e la coincidenza non è casuale: il listino di punta si è assestato lì.

La differenza sta sotto la riga. La lettura della cache su Astra costa 1,00$ per milione di token, mentre Anthropic l'ha appena portata a 0,25$. Sono quattro volte tanto, e su un carico agentico dove lo stesso contesto viene riletto decine di volte quella voce diventa la maggior parte del conto.

Poi ci sono due moltiplicatori da tenere a mente. Sopra i 272.000 token di input le tariffe di input e di cached input raddoppiano e l'output va a moltiplicatore uno e mezzo, quindi la finestra da un milione di token esiste ma costa il doppio nella metà superiore. E la modalità Fast, che serve quando la latenza conta, viaggia a tariffe circa doppie rispetto allo standard.

La finestra di contesto dichiarata è di 1.050.000 token, con un massimo di 922.000 in ingresso e 128.000 in uscita.

Morale: sul listino base i due modelli pareggiano, sul conto reale dipende da quanto contesto ricicli. Se ti interessa il metodo per stimarlo prima di firmare, ne abbiamo scritto in quanto costa Claude per un'azienda, e il ragionamento sui token vale identico per qualsiasi fornitore.

Ricevi aggiornamenti su Claude e AI per aziende

Una email quando c'è qualcosa che vale la pena leggere. Niente spam.

Stai valutando Claude per la tua azienda? Scopri quanto costa o quale piano scegliere

Primo modello Critical: cosa comporta il programma Daybreak

Questa è la parte che in Italia è passata quasi inosservata e che invece è la più rilevante.

Astra è il primo modello OpenAI a raggiungere la soglia Critical del Preparedness Framework per le capacità cyber offensive. Non è una etichetta di marketing rovesciata: è l'azienda che dichiara che il proprio modello è abbastanza capace, in ambito offensivo, da richiedere accesso controllato.

La conseguenza pratica è che le capacità legate alla creazione di exploit sono chiuse dietro Daybreak, un programma riservato a professionisti della sicurezza verificati, che hanno ricevuto il modello per primi. Il resto del mondo ottiene Astra con i guardrail attivi.

C'è un precedente che aiuta a capire perché la cosa è seria: nei mesi scorsi un agente OpenAI è uscito dalla propria sandbox durante un incidente su Hugging Face. Un modello che usa il computer meglio di prima è più utile e, allo stesso tempo, sposta il perimetro di quello che va contenuto.

Per chi si occupa di sicurezza in azienda il messaggio è pratico e non teorico: la capacità offensiva disponibile sul mercato è cresciuta, quindi cresce anche quella dalla parte di chi attacca. Il tema lo abbiamo affrontato in AI e cybersecurity per le aziende.

Opaque recurrence: il ragionamento non si vede più

Astra introduce una tecnica che OpenAI chiama opaque recurrence e che, in sostanza, oscura la catena di ragionamento del modello. Quello che prima era ispezionabile, almeno in parte, ora non lo è.

OpenAI sostiene che sia una conseguenza naturale dell'aumento di capacità. L'UK AI Safety Institute ha segnalato una regressione sulla monitorabilità della catena di ragionamento. Le due cose possono essere vere insieme, e non si escludono.

Se il tuo lavoro è generare testo, cambia poco. Se il tuo lavoro è documentare come è stata presa una decisione automatizzata, cambia molto. Un sistema che decide su pratiche, candidature, credito o accessi va accompagnato da una spiegazione difendibile, e un ragionamento non ispezionabile rende quella spiegazione più difficile da costruire. Vale anche in ottica AI Act, dove la trasparenza dei sistemi non è un valore astratto ma un obbligo con tempi definiti: ne abbiamo scritto in AI e compliance normativa.

Detto senza polemica: è una scelta di progetto legittima che sposta un pezzo di onere sull'utilizzatore. Chi la adotta dovrebbe saperlo prima, non dopo.

Dove si prende, e dove ancora no

Il rollout è partito il 3 settembre dai clienti Daybreak e nei giorni successivi si è aperto ai piani Plus, Pro, Business ed Enterprise, oltre che via API. Sam Altman ha confermato qualche intoppo iniziale.

Sul fronte cloud c'è Amazon Bedrock. Manca, al momento, Azure: cosa curiosa da scrivere per il modello di OpenAI, e non irrilevante per le molte aziende italiane che hanno standardizzato tutto sullo stack Microsoft.

Sui workspace enterprise il modello arriva disattivato per default e va abilitato dall'amministratore. È un buon default e conviene usarlo bene: prima di aprirlo a tutti, decidere chi può usarlo e per cosa.

Gli utenti del piano gratuito per ora restano fuori.

Cosa significa per un'azienda italiana

Tre cose concrete, al netto dell'entusiasmo da lancio.

La prima. Se hai processi in cui qualcuno passa ore a spostare dati tra un portale, un foglio e un gestionale, questa generazione di modelli che usa il computer li aggredisce sul serio. Non è più una demo. Vale la pena mappare due o tre di quei processi e misurare quanto tempo valgono, perché è lì che il ritorno si vede in settimane e non in trimestri. Il metodo per farlo lo abbiamo messo in ordine in come si misura il ritorno di un progetto AI.

La seconda. Non cambiare fornitore per un annuncio. I due modelli di punta oggi costano lo stesso e vincono su terreni diversi, quindi la domanda giusta non è quale sia il migliore ma quale sia il migliore sui tuoi tre compiti reali, misurati con i tuoi dati. Il confronto puntuale lo abbiamo scritto in Astra o Fable 5.1.

La terza, la meno divertente. Un modello classificato critico sul cyber e con ragionamento non ispezionabile è un tema di governance, non solo di procurement. Chi lo abilita in azienda dovrebbe aver deciso prima chi può usarlo, su quali dati e con quale tracciamento. Farlo dopo il primo incidente costa molto di più.

FT
Federico Thiella·Founder, Maverick AI

Lavora con aziende italiane ed europee sull'adozione di Claude e dell'ecosistema Anthropic. Ha guidato implementazioni AI in private equity, consulenza, manifattura e servizi professionali.

LinkedIn

Vuoi sapere quale modello conviene sui tuoi processi?

Prendiamo due o tre compiti reali della tua azienda, li misuriamo sui modelli di punta oggi disponibili e ti diamo i numeri: qualità, tempi e costo per compito. Senza tifoserie.

Scrivici

Domande frequenti su GPT-6 Astra

È il modello di punta di OpenAI rilasciato il 3 settembre 2026, presentato come salto generazionale rispetto alla linea GPT-5.6. Il posizionamento principale è l'uso del computer e del browser: apre fogli, compila moduli, naviga tra le pagine e completa flussi documentali, secondo OpenAI con il 47% di tempo in meno rispetto al modello precedente. Gli altri due terreni rivendicati sono la matematica avanzata e la cybersecurity difensiva.
Dieci dollari per milione di token in ingresso e cinquanta in uscita, lo stesso listino di Claude Fable 5.1. La lettura della cache costa 1,00$ per milione di token. Sopra i 272.000 token di input le tariffe di input e cached input raddoppiano e l'output va a moltiplicatore uno e mezzo. La modalità Fast, per chi ha bisogno di meno latenza, costa circa il doppio dello standard.
Perché quel risultato è ottenuto con una harness stateful, cioè un'impalcatura che mantiene lo stato tra i tentativi ed è costosa da far girare. Con chiamate API stateless, che sono quelle di un'integrazione normale, i risultati riportati scendono molto, in una forbice indicata tra il 17% e il 63% a seconda della fonte. Il numero non è falso, ma non descrive quello che otterresti in produzione.
È il programma riservato a professionisti della sicurezza verificati attraverso cui OpenAI dà accesso alle capacità più sensibili di Astra, in particolare quelle legate alla creazione di exploit. Serve perché Astra è il primo modello OpenAI a raggiungere la soglia Critical del Preparedness Framework per capacità cyber offensive. I clienti Daybreak hanno ricevuto il modello per primi, il resto degli utenti lo usa con i guardrail attivi.
Sui piani a pagamento di ChatGPT, quindi Plus, Pro, Business ed Enterprise, oltre che via API. Sul fronte cloud è su Amazon Bedrock, mentre al momento manca su Azure. Sui workspace enterprise arriva disattivato per default e va abilitato dall'amministratore. Il piano gratuito per ora è escluso.
Non per un annuncio. I due modelli di punta costano lo stesso di listino e vincono su terreni diversi: Astra su matematica e automazione desktop, Claude Fable 5.1 su coding agentico lungo, su Humanity's Last Exam con strumenti e sul costo della cache, quattro volte più bassa. La scelta ragionevole è misurare due o tre compiti reali della propria azienda su entrambi, con i propri dati, e decidere per carico invece che una volta per tutte.

Rimani informato sull'AI per il business

Ricevi aggiornamenti su Claude AI, casi d'uso aziendali e strategie di implementazione. Niente spam, solo contenuti utili.

Vuoi saperne di più?

Contattaci per scoprire come possiamo aiutare la tua azienda con soluzioni AI su misura.

System integrator specializzato su Claude AI in Italia. Lavoriamo con aziende in PE, pharma, fashion, manifattura e consulting.

Articoli correlati

Confronto

GPT-6 Astra o Claude Fable 5.1: stesso listino, conto diverso

Confronto tra GPT-6 Astra e Claude Fable 5.1: prezzi reali oltre il listino, benchmark affiancati con le dovute avvertenze, governance e disponibilità cloud, e come scegliere in base al tipo di carico.

News & Aggiornamenti

Claude Fable 5.1: la cache costa il 75% in meno e per gli agenti cambia il conto

Il 1 settembre 2026 Anthropic ha rilasciato Claude Fable 5.1 e Mythos 5.1. Cosa dicono i benchmark, perché il taglio del 75% sulla lettura della cache conta più dei benchmark e i tre breaking change API da sistemare prima di aggiornare.

Confronto

Claude vs GPT-5.6: il confronto sui nuovi modelli OpenAI (Sol, Terra, Luna)

OpenAI ha presentato GPT-5.6 (Sol, Terra, Luna). Come si confrontano con Claude su qualità, prezzo, sicurezza e disponibilità — e cosa conviene davvero alle aziende.

Strategia

Quanto costa Claude AI per le aziende: pricing, piani e costi reali

Guida completa ai costi di Claude AI per le aziende. Pricing API per modello, piani enterprise, costi tipici di un progetto di integrazione e come ottimizzare la spesa.

Cybersecurity

AI e cybersecurity: cosa deve sapere chi gestisce un'azienda nel 2026

Un'AI ha trovato bug critici vecchi di decenni in ogni sistema operativo e browser. Cosa significa per la sicurezza della tua azienda e cosa fare subito.

Settore

Claude AI per la compliance normativa: GDPR, antiriciclaggio e monitoraggio regolamentare

Come usare Claude AI per automatizzare la compliance normativa: GDPR, antiriciclaggio, D.Lgs 231, monitoraggio dei cambiamenti regolamentari e gestione del rischio.

Prenota una call conoscitiva
GPT-6 Astra: novità, prezzi e benchmark 2026 | Maverick AI