Cluster · benchmark GPT-6 Astra
GPT-6 Astra: tutti i benchmark ufficiali
Le tabelle complete dei benchmark di GPT-6 Astra pubblicate da OpenAI, con le note metodologiche e i test dove perde.
Tempo di lettura: 11 min
Guida operativa · Confronti modelli AI

OpenAI ha pubblicato con GPT-6 Astra un insieme di tabelle insolitamente completo: sette aree, oltre trenta benchmark e i punteggi di cinque modelli concorrenti accanto ai propri — comprese le righe in cui Astra non è primo.
Questa pagina raccoglie quei numeri per intero, con le note metodologiche che ne cambiano il significato. Dati verificati il 4 settembre 2026 sull'annuncio ufficiale.
In sintesi
- I punteggi sono il massimo a qualunque livello di ragionamento.
- Distacchi enormi su ARC-AGI-3, lavoro da terminale e cyber.
- Astra non vince su cinque righe: OpenAI le pubblica comunque.
- Diverse note metodologiche cambiano cosa si può affermare.
- Alcuni modelli sono esclusi da test che rifiutano.
- Nessuno di questi numeri predice il tuo caso.
Ragionamento astratto
| Benchmark | Astra | GPT-5.6 Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| ARC-AGI-3 | 99,9% | 7,8% | — | — | 30,2% |
| ARC-AGI-2 | 95,0% | 92,5% | 90,0% | 89,2% | 90,4% |
| ARC-AGI-1 | 98,5% | 97,5% | 97,5% | 98,5% | 97,5% |
Il salto su ARC-AGI-3 è il risultato più impressionante dell'intero annuncio: da 7,8% del modello precedente a 99,9%. La ARC Prize Foundation, citata da OpenAI, afferma che Astra ha superato la loro linea di riferimento umana per efficienza d'azione sul 96% dei livelli.
Va però letta la nota: su questo test Astra è stato eseguito con un'impalcatura che cambia due impostazioni rispetto alla configurazione standard. OpenAI precisa che le modifiche non erano mirate a quel benchmark. Il quadro completo è in GPT-6 Astra e ARC-AGI-3.
Sulle versioni precedenti del test i distacchi si riducono a pochi punti, e su ARC-AGI-1 Fable 5 pareggia esattamente Astra.
Uso del computer
| Benchmark | Astra | Sol | Fable 5 | Opus 5 |
|---|---|---|---|---|
| Agents' Last Exam | 59,3% | 53,6% | 48,7% | 55,5% |
| OSWorld 2.0 | 72,6% | 65,7% | — | 70,2% |
| ScreenSpot-Pro (senza tool) | 92,7% | 76,9% | 87,3% | — |
Qui il primato è netto ma i margini sono più stretti di quanto la comunicazione suggerisca: su Agents' Last Exam la distanza da Opus 5 è di 3,8 punti, su OSWorld 2.0 di 2,4 punti.
Il dato più utile è però quello di efficienza: su Agents' Last Exam OpenAI dichiara circa il 65% di token di output in meno rispetto a Opus 5 alle impostazioni di punteggio massimo. Su un modello con l'output a 50 dollari per milione di token, è una differenza che conta quanto il punteggio.
Lavoro professionale
| Benchmark | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| AutomationBench | 41,4% | 18,1% | 31,4% | 17,4% | 26,9% |
| BenchCAD | 95,9% | 83,3% | 84,3% | 67,5% | 82,1% |
| BrowseComp | 91,5% | 90,4% | — | 87,4% | 90,8% |
| OpenScore String Quartets | 0,84 | 0,19 | — | — | — |
| Design Tasks (interno) | 50,0% | 47,4% | — | 35,8% | — |
| Data Science Tasks (interno) | 40,9% | 30,5% | — | 34,7% | — |
| AA Intelligence Index v4.1.1 | 61,2 | 60,9 | 65,7 | 62,1 | 63,1 |
L'ultima riga è la più interessante e la meno citata: sull'Artificial Analysis Intelligence Index, che è una misura di terza parte e non un test interno, Astra è quarto fra i modelli confrontati, dietro a Fable 5.1, Opus 5 e Fable 5.
Su BenchCAD va letta la nota: i punteggi dei modelli Claude riflettono tre modifiche alla valutazione, dettagliate nella scheda di sistema di Fable 5.1.
Coding
| Benchmark | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% |
| FrontierCode 1.1 Extended | 64,5% | 60,6% | 63,6% | 64,9% | 63,6% |
| FrontierCode 1.1 Main | 53,3% | 47,5% | 50,9% | 53,5% | 53,4% |
| DB Migration (interno) | 63,9% | 42,7% | 57,8% | 50,3% | — |
| AA Coding Agent Index v1.4 | 67,0 | 65,1 | — | 67,2 | 68,1 |
Il quadro sul coding è più sfumato di quanto l'annuncio lasci intendere. Astra vince nettamente su Terminal-Bench 4.0 e sulle migrazioni di database interne, ma su FrontierCode — sia Extended sia Main — Fable 5 è avanti di frazioni di punto, e sull'indice di coding di Artificial Analysis Opus 5 è primo.
Su FrontierCode va segnalata una nota: Astra è stato eseguito con un messaggio di sistema simile a quello usato in Codex, che chiede di evitare file di test superflui e di seguire le convenzioni del repository. OpenAI precisa che il prompt non era ottimizzato per quel test.
Scienza, matematica e salute
| Benchmark | Astra | Sol | Fable 5.1 | Fable 5 | Opus 5 |
|---|---|---|---|---|---|
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | 52,6% | 21,4% | 30,0% |
| FrontierMath Tier 4 (v2) | 97,6% | 83,0% | 87,8% | 90,2% | 73,2% |
| GPQA Diamond | 96,0% | 94,6% | 93,7% | 92,6% | 93,7% |
| Humanity's Last Exam (con tool) | 57,2% | — | 65,0% | 63,8% | 63,6% |
| HealthBench Professional | 63,4% | 60,5% | 58,1% | 60,9% | 56,4% |
Su Humanity's Last Exam il divario è ampio e a sfavore: 57,2% contro il 65,0% di Fable 5.1, quasi otto punti. È il risultato più lontano dal racconto generale dell'annuncio, e OpenAI lo pubblica nella stessa tabella.
Da notare anche una discrepanza interna: l'introduzione parla di un 98% su FrontierMath Tier 4, mentre la tabella riporta 97,6%. Il valore strutturato è quello della tabella.
Tre valutazioni scientifiche — LifeSciBench, GeneBench Pro e MedChemBench — riportano solo Astra e Sol. La nota spiega perché: i modelli Fable rifiutano la maggior parte delle domande di quelle prove.
Cybersecurity
| Benchmark | Astra | Sol | Fable 5.1 | Opus 5 |
|---|---|---|---|---|
| ExploitBench | 100,0% | 78,5% | — | 70% |
| ExploitGym | 42,4% | 30,3% | 30,4% | 22,0% |
| ExploitBench (giu–ago 2026) | 39,0% | 5,5% | — | — |
| SRE-Bench | 88,0% | 55,9% | — | 12,5% |
| SEC-Bench Pro | 85,4% | 79,1% | — | — |
Il 100% su ExploitBench e l'88% su SRE-Bench contro il 12,5% di Opus 5 sono i distacchi più ampi dell'intero annuncio. OpenAI dichiara che durante la valutazione Astra ha individuato e usato due vulnerabilità precedentemente sconosciute, comunicate ai manutentori.
Due note importanti. Il 5,5% di Sol sulla prova giugno–agosto è definito da OpenAI un artefatto di un limite di 300 turni: a limiti più larghi lo stesso modello fa 11,5%. E su ExploitGym i punteggi Fable citati provengono da una variante con meno protezioni.
Il quadro completo, comprese le implicazioni per l'uso in azienda, è in GPT-6 Astra e la cybersecurity.
Contesto lungo e allineamento
| Benchmark | Astra | Sol |
|---|---|---|
| MRCR v2 8-needle 256K–512K | 100,0% | 91,5% |
| MRCR v2 8-needle 512K–1M | 96,3% | 73,8% |
| Sicurezza uso computer (più basso è meglio) | 2,4% | 22,0% |
| Circumvention (più basso è meglio) | 0,00% | 0,29% |
| Allucinazione interna (più basso è meglio) | 4,2% | 12,2% |
Il recupero di informazioni su contesti oltre il mezzo milione di token è l'area con il miglioramento più regolare rispetto alla generazione precedente. Sulle metriche di allineamento, dove più basso è meglio, i valori di Astra sono da tre a dieci volte migliori.
Esempi pratici
Azienda che valuta un agente per compiti da terminale. Terminal-Bench 4.0 e Terminal-Bench Science sono le righe pertinenti, e lì il vantaggio è netto. Vale la prova sui propri flussi.
Team che sceglie un modello per lo sviluppo quotidiano. Qui il quadro è ambiguo: dipende se il lavoro somiglia più a Terminal-Bench (Astra avanti) o a FrontierCode e all'indice di Artificial Analysis (Claude avanti o pari).
Studio che deve rispondere a domande difficili di dominio. Humanity's Last Exam suggerisce cautela: su quel tipo di prova Astra è dietro di quasi otto punti.
Errori da evitare
- Citare solo le righe vinte. Le sconfitte sono nelle stesse tabelle.
- Confrontare con run a effort fisso. Qui è il massimo a qualunque livello.
- Ignorare le note metodologiche, che cambiano cosa si può affermare.
- Attribuire a Google i dati Gemini presenti in tabelle OpenAI.
- Trasferire un punteggio al proprio caso senza provarlo.
- Guardare il punteggio senza il costo con cui è stato ottenuto.
Come applicarlo in azienda
Questi numeri hanno un uso preciso e limitato: restringere il campo a due o tre candidati, guardando solo le righe della famiglia del tuo compito.
Se il tuo lavoro è agentico o da terminale, guarda Terminal-Bench e Agents' Last Exam. Se è coding, guarda FrontierCode e l'indice di Artificial Analysis oltre a Terminal-Bench, perché raccontano cose diverse. Se è conoscenza di dominio, guarda GPQA e Humanity's Last Exam — e lì il verdetto cambia.
Poi passa alla prova che decide: dieci casi reali del tuo processo, di cui tre difficili e uno a cui manca l'informazione richiesta, con lo stesso materiale per ogni candidato e la valutazione affidata a chi conosce il lavoro. Il metodo è in come si leggono i benchmark AI.
Le affermazioni di costo, benchmark per benchmark
Una cosa rara in questo annuncio: accanto a diversi punteggi OpenAI dichiara anche il costo con cui sono stati ottenuti. Vale la pena raccoglierle, perché per un'azienda contano quanto il risultato.
| Benchmark | Risultato | Costo dichiarato |
|---|---|---|
| Terminal-Bench Science 0.1 | 64,6% vs 52,6% di Fable 5.1 | ~31% in meno |
| Terminal-Bench Science (impostazione bassa) | 61,1% vs 22,4% di Sol | ~27% in meno |
| Terminal-Bench 4.0 | 57,9% | ~9% meno di Sol, ~63% meno di Fable 5.1 |
| BenchCAD | 95,9% | ~43% meno di Sol, ~86% meno di Fable 5.1 |
| GPQA Diamond (impostazione bassa) | 94,9% vs 94,6% di Sol | ~37% in meno |
| Agents' Last Exam | 59,3% | ~65% di token di output in meno di Opus 5 |
La riga su GPQA è la più interessante per un uso reale: a un'impostazione meno costosa, Astra supera comunque il miglior risultato della generazione precedente, spendendo circa un terzo in meno. È il tipo di dato che dice qualcosa sull'economia del modello, non solo sulla sua capacità.
Restano stime dichiarate dal produttore, non misurazioni indipendenti. Ma pubblicare il costo accanto al punteggio è un passo avanti rispetto alla norma del settore, dove si mostra il risultato e si tace quanto è costato ottenerlo — il problema descritto in perché i benchmark dei vendor non sono comparabili.
Velocità: il dato che manca quasi sempre
Accanto ai punteggi l'annuncio riporta due misure di tempo, che sono rare e utili.
Su OSWorld 2.0, in simulazioni di latenza, Astra ottiene 72,6% impiegando circa 40 minuti per task, contro il 65,7% in circa 75 minuti della generazione precedente: più risultato in circa il 47% del tempo in meno.
Sul benchmark Mind2Web, con l'impalcatura Codex aggiornata, OpenAI dichiara un completamento dei task 1,9 volte più veloce rispetto all'esperienza con GPT-5.6 Sol.
Cosa manca in queste tabelle
Per completezza, tre cose che i benchmark pubblicati non dicono e che decidono un progetto aziendale.
Come si comporta sui tuoi documenti. Nessuna di queste prove usa il tuo linguaggio interno, i tuoi formati o i tuoi casi limite.
Come sbaglia. Un modello che davanti a un'informazione mancante dichiara di non averla trovata è utilizzabile; uno che produce un valore plausibile genera errori che nessuno verificherà. Le tabelle di allineamento si avvicinano a misurarlo, ma solo su compiti generici.
Quanto costa il compito completato. Le stime di costo pubblicate riguardano il singolo benchmark, non il tuo flusso con il tuo prompt di sistema, i tuoi tentativi falliti e la tua revisione umana.
Il resto del percorso, in tre pagine. Il confronto con la generazione precedente è in GPT-6 Astra: cos'è e cosa cambia. Per i benchmark su cui il modello resta indietro, GPT-6 Astra: prezzi e come si paga. Il metodo per verificare tutto sui tuoi casi è in Dove GPT-6 Astra non è il migliore.
Conclusione
Le tabelle di Astra sono fra le più complete pubblicate da un fornitore, e includono le righe in cui il modello perde. Il primato è netto su uso del computer, compiti da terminale, cyber e ragionamento astratto; è discutibile sul coding generale e assente su alcune misure aggregate di terza parte.
Il modo corretto di usarle è come filtro iniziale. Nessuno di questi numeri dice come andrà sui tuoi documenti — quello lo dice solo una prova sui tuoi casi.
Se vuoi capire quale modello ha senso per il tuo processo e portarlo in produzione, Giallo Studio progetta agenti e automazioni AI su misura per le PMI.
Schema consigliato: Article + FAQPage + BreadcrumbList
Risorse correlate
FAQ
Quali sono i risultati principali di GPT-6 Astra?
Fra i più alti pubblicati: 99,9% su ARC-AGI-3, 97,6% su FrontierMath Tier 4, 100% su ExploitBench, 96,0% su GPQA Diamond e 57,9% su Terminal-Bench 4.0.
I punteggi sono confrontabili con altri test?
Con cautela. OpenAI specifica che i punteggi sono il massimo ottenuto a qualunque livello di ragionamento, quindi non sono confrontabili con esecuzioni a livello fisso o a costo controllato.
Su quali benchmark GPT-6 Astra non vince?
Su Artificial Analysis Intelligence Index (61,2 contro 65,7 di Fable 5.1), Humanity's Last Exam (57,2% contro 65,0%), Artificial Analysis Coding Agent Index (67,0 contro 68,1 di Opus 5) e FrontierCode, dove Fable 5 è avanti di poco.
Ci sono note metodologiche da conoscere?
Sì, diverse. Su ARC-AGI-3 Astra è stato eseguito con due impostazioni modificate; su BenchCAD i punteggi Claude riflettono tre modifiche alla valutazione; su alcuni test i punteggi Fable provengono da una variante con meno protezioni.
Perché alcuni modelli mancano da certe righe?
OpenAI specifica che Fable 5 e 5.1 sono esclusi da tre valutazioni scientifiche perché rifiutano la maggior parte delle domande di quelle prove.
Questi benchmark predicono come andrà sui miei documenti?
No. Misurano compiti generici in condizioni controllate. Servono a restringere il campo a due o tre candidati, poi la decisione si prende provando sui propri casi reali.




