Pillar · GPT-6 Astra
GPT-6 Astra: cos'è e cosa cambia
Cos'è GPT-6 Astra, il nuovo modello OpenAI: specifiche ufficiali, prezzi, benchmark verificati e dove non è il migliore.
Tempo di lettura: 12 min
Guida operativa · Confronti modelli AI

GPT-6 Astra è il nuovo modello di punta di OpenAI, presentato come il più capace per il lavoro complesso portato a termine da un capo all'altro. Le affermazioni dell'annuncio sono importanti: risultati allo stato dell'arte su uso del computer, navigazione, ingegneria del software, cybersecurity, scienza e lavoro professionale.
Questa guida raccoglie solo dati verificati sulle due fonti ufficiali — l'annuncio e la scheda tecnica dell'API — e include anche i benchmark su cui Astra non è il migliore, perché sono nelle stesse tabelle pubblicate da OpenAI.
Dati verificati il 4 settembre 2026.
In sintesi
- Contesto 1.050.000 token, output massimo 128.000, cutoff 30 aprile 2026.
- Prezzo Standard: 10 $ input / 50 $ output per milione di token.
- Oltre 272K token di prompt la tariffa cambia sull'intera richiesta.
- Cinque livelli di ragionamento: low, medium, high, xhigh, max.
- Su alcuni benchmark resta dietro a Claude: OpenAI lo pubblica.
- Niente audio né video, e niente fine-tuning.
La scheda tecnica
Tutti i valori vengono dalla pagina modello della documentazione OpenAI.
| Caratteristica | GPT-6 Astra |
|---|---|
| Identificativo API | gpt-6-astra |
| Finestra di contesto | 1.050.000 token |
| Output massimo | 128.000 token |
| Data limite conoscenza | 30 aprile 2026 |
| Livelli di ragionamento | low, medium, high, xhigh, max |
| Input | testo e immagini |
| Output | solo testo |
| Audio e video | non supportati |
| Fine-tuning | non supportato |
L'assenza di audio e video merita attenzione: se il tuo progetto prevede trascrizione o analisi di contenuti parlati, questo modello non è la risposta e serve affiancarne un altro.
Sul fronte degli strumenti la dotazione è invece ampia: ricerca web, ricerca file, generazione immagini, interprete di codice, shell ospitata, applicazione di patch, uso del computer, MCP e ricerca tra strumenti.
Quanto costa
| Voce | Prezzo per 1M token |
|---|---|
| Input | 10 $ |
| Input da cache | 1 $ |
| Scrittura in cache | 12,50 $ |
| Output | 50 $ |
Ci sono tre condizioni che cambiano il conto e che vanno conosciute prima di preventivare.
La soglia dei 272K token. I prompt che superano i 272.000 token di input vengono fatturati al doppio per input e cache e a una volta e mezza in output — e la maggiorazione si applica all'intera richiesta, non solo alla parte eccedente.
Batch e Flex. Costano il 50% delle tariffe Standard. Su lavorazioni che non hanno urgenza è un dimezzamento immediato.
Fast mode. Offre fino al doppio della velocità al doppio del prezzo.
Dove è davvero avanti
Le tabelle ufficiali mostrano distacchi netti in alcune aree precise. Riportiamo i confronti come pubblicati, ricordando che i punteggi sono il massimo a qualunque livello di ragionamento.
| Benchmark | Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| ARC-AGI-3 | 99,9% | 7,8% | 30,2% |
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | 30,0% |
| SRE-Bench | 88,0% | 55,9% | 12,5% |
| AutomationBench | 41,4% | 18,1% | 26,9% |
| ScreenSpot-Pro (senza tool) | 92,7% | 76,9% | — |
| Terminal-Bench 4.0 | 57,9% | 37,3% | 52,6% |
I distacchi più grandi sono su ragionamento astratto, lavoro scientifico da terminale e reverse engineering. Su ARC-AGI-3 la differenza è di un ordine di grandezza rispetto ai modelli confrontati.
OpenAI riporta anche il giudizio della ARC Prize Foundation, secondo cui Astra ha superato la loro linea di riferimento umana per efficienza d'azione sul 96% dei livelli. È una dichiarazione di terza parte, il che la rende più solida di un'autovalutazione.
Dove invece resta indietro
Questa è la parte che quasi nessun articolo riporta, e sta nelle stesse tabelle.
| Benchmark | Astra | Miglior concorrente |
|---|---|---|
| Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 65,7 — Fable 5.1 |
| Humanity's Last Exam (con tool) | 57,2% | 65,0% — Fable 5.1 |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 68,1 — Opus 5 |
| FrontierCode 1.1 Extended | 64,5% | 64,9% — Fable 5 |
| FrontierCode 1.1 Main | 53,3% | 53,5% — Fable 5 |
Su Humanity's Last Exam il divario è ampio e a sfavore: quasi otto punti. Sull'indice di intelligenza di Artificial Analysis, che è una misura di terza parte, Astra è quarto fra i modelli confrontati.
Il quadro onesto è quindi: dominio netto su uso del computer, agentico e ragionamento astratto; parità o svantaggio su alcune misure aggregate e sulla conoscenza accademica difficile. L'analisi completa è in dove GPT-6 Astra non è il migliore.
Le affermazioni di efficienza
OpenAI accompagna diversi punteggi con un dato di costo, cosa rara e utile.
- Terminal-Bench Science: 64,6% contro 52,6% di Fable 5.1, a ~31% di costo API stimato in meno
- Agents' Last Exam: ~65% di token di output in meno rispetto a Opus 5
- OSWorld 2.0: 72,6% in ~40 minuti per task contro 65,7% in ~75 minuti di Sol
- BenchCAD: ~43% in meno di Sol e ~86% in meno di Fable 5.1
- Codex aggiornato: 1,9× più veloce di Sol su Mind2Web
Sono stime di costo dichiarate dal produttore, non misurazioni indipendenti. Ma il fatto che vengano pubblicate accanto ai punteggi è già un passo avanti rispetto alla norma del settore, dove si mostra il risultato e si tace quanto è costato ottenerlo.
Sicurezza e allineamento
Due elementi meritano di essere riportati perché cambiano il modo di usare il modello in azienda.
Il primo è positivo: in una valutazione costruita a partire da un incidente reale, il modello precedente senza protezioni andava oltre il target autorizzato nel 48% dei casi, mentre Astra lo fa nello 0%. Sulle allucinazioni relative alle proprie capacità, OpenAI dichiara Astra tre volte meno probabile di sbagliare rispetto a Sol.
Il secondo è un limite dichiarato: il ragionamento scritto di Astra è risultato più difficile da monitorare di quello del modello precedente. OpenAI lo scrive esplicitamente e dice di prendere la cosa sul serio.
Esempi pratici
Studio professionale che valuta l'aggiornamento. Il compito è rispondere a domande sui documenti dello studio. Astra è sovradimensionato: il lavoro è di recupero e riformulazione, e una fascia più bassa lo svolge a una frazione del costo. La domanda giusta non è se Astra sia migliore, ma se il compito richieda quella capacità.
Azienda con un agente che compila moduli e aggiorna il CRM. Qui il quadro cambia: è esattamente l'area in cui Astra mostra i distacchi maggiori, e l'annuncio cita proprio la compilazione di moduli e l'aggiornamento di anagrafiche clienti. Vale la prova sui propri flussi, misurando quanti compiti arrivano a conclusione senza intervento.
Software house che valuta il passaggio per lo sviluppo. Su Terminal-Bench 4.0 il vantaggio è netto, ma sull'indice di coding di Artificial Analysis Astra è dietro a Opus 5. Significa che il verdetto dipende dal tipo di lavoro: forte sui compiti da terminale, meno distintivo sulla programmazione in senso ampio.
Errori da evitare
- Leggere solo i benchmark vinti. Le sconfitte sono nelle stesse tabelle.
- Confrontare con run a effort fisso. I punteggi sono il massimo a qualunque livello.
- Preventivare senza la soglia dei 272K, che raddoppia l'input.
- Assumere il supporto audio o video, che non c'è.
- Attribuire a Google i dati di Gemini presenti nelle tabelle OpenAI.
- Adottarlo per compiti semplici, dove una fascia bassa basta.
Come applicarlo in azienda
Il percorso sensato non parte dall'adozione ma da una domanda: il mio compito appartiene alle aree dove Astra è davvero avanti?
Se il lavoro è uso del computer, automazione multi-passo, ricerca scientifica da terminale o reverse engineering, i distacchi pubblicati sono ampi e la prova vale la pena. Se invece è classificare messaggi, estrarre campi o rispondere da una base documentale, il modello è sovradimensionato e la spesa non si giustifica: il criterio è in quando basta un modello economico.
Verificata la pertinenza, la prova è quella di sempre: dieci casi reali del tuo processo, di cui tre difficili e uno a cui manca l'informazione richiesta. Misura tre cose — quanti arrivano a conclusione senza intervento, quanto costa ogni compito completato e quanto tempo richiede.
Se il tuo carico non ha urgenza, ricorda che Batch e Flex costano metà: su elaborazioni notturne è un risparmio che non costa nulla in termini di risultato.
Infine, tieni l'identificativo del modello in un unico punto configurabile. In questo settore i cataloghi cambiano più volte l'anno, e il criterio per decidere quando rimettere in discussione la scelta è in quando conviene cambiare modello AI.
Cosa cambia rispetto alla generazione precedente
Il confronto con GPT-5.6 Sol è quello più solido fra tutti, perché è interno: stesso produttore, stessa impalcatura, stesso interesse a mostrare un progresso reale.
| Benchmark | Astra | Sol | Differenza |
|---|---|---|---|
| ARC-AGI-3 | 99,9% | 7,8% | oltre 12× |
| SRE-Bench | 88,0% | 55,9% | +32 punti |
| ScreenSpot-Pro | 92,7% | 76,9% | +16 punti |
| Terminal-Bench Science 0.1 | 64,6% | 22,4% | +42 punti |
| Terminal-Bench 4.0 | 57,9% | 37,3% | +21 punti |
| AutomationBench | 41,4% | 18,1% | +23 punti |
| MRCR 512K-1M | 96,3% | 73,8% | +23 punti |
| GPQA Diamond | 96,0% | 94,6% | +1,4 punti |
L'ultima riga è la più istruttiva: sulla conoscenza scientifica di livello universitario il guadagno è di poco più di un punto, mentre sui compiti agentici e di uso del computer è di decine di punti.
È il segnale più chiaro sulla direzione di questo modello: non è "sa più cose", è "porta a termine più lavoro". Per un'azienda la distinzione è tutt'altro che accademica, perché sposta il tipo di progetti che diventano realizzabili.
Il confronto completo, con i costi dichiarati per ciascun test, è in GPT-6 Astra vs GPT-5.6 Sol.
Le note metodologiche che vanno lette
In fondo all'annuncio ci sono footnote che cambiano il significato di alcuni numeri. Vale la pena riportarle, perché nessun riassunto le include.
- Su ARC-AGI-3 Astra è stato eseguito con un'impalcatura che cambia due impostazioni rispetto alla configurazione standard
- Su BenchCAD i punteggi dei modelli Claude riflettono tre modifiche alla valutazione
- Su ScreenSpot-Pro ed ExploitGym i punteggi Fable citati provengono da una variante con meno protezioni
- Fable 5 e 5.1 sono esclusi da tre valutazioni scientifiche perché rifiutano la maggior parte delle domande
- Il 5,5% di Sol su una prova cyber è un artefatto di un limite di 300 turni: a limiti più larghi fa 11,5%
C'è anche una discrepanza interna: l'introduzione parla di un punteggio del 98% su FrontierMath Tier 4, mentre la tabella riporta 97,6%. In questa guida usiamo sempre il valore della tabella, che è il dato strutturato.
Disponibilità e accesso
Secondo l'annuncio, Astra arriva su ChatGPT Plus, Pro, Business ed Enterprise, oltre che via API OpenAI, Microsoft Azure e AWS Bedrock.
Due dettagli operativi che contano per chi lo deve introdurre in azienda. Il primo: sugli account Enterprise l'accesso è disattivato di default al lancio, e serve che un amministratore lo abiliti per lo spazio di lavoro. Il secondo: gli utenti Pro, Business ed Enterprise ottengono anche GPT-6 Astra Pro, una variante distinta.
L'uso rientra nelle soglie già incluse negli abbonamenti, con la possibilità di acquistare crediti aggiuntivi. Per i clienti API idonei è supportata la conservazione zero dei dati, che per chi tratta informazioni riservate è spesso la condizione che sblocca il progetto.
Sul fronte dei limiti tecnici, la scheda indica soglie di traffico che crescono con il livello dell'account: si parte da 500 richieste al minuto e 500.000 token al minuto sul primo livello, fino a valori molto più alti sui livelli superiori. Il piano gratuito non è supportato.
La guida pratica all'uso via API, con endpoint e strumenti disponibili, è in GPT-6 Astra via API; il lato ChatGPT è in ChatGPT Astra: come usarlo.
I risultati scientifici citati
L'annuncio riporta due risultati di matematica pura che vale la pena isolare, perché sono verificabili e diversi da un punteggio di benchmark.
Il primo riguarda quanto vicini possano stare i numeri primi lungo la retta numerica. Per oltre un decennio il miglior risultato noto stabiliva che esistono infinite coppie di primi a distanza al massimo 246; un lavoro recente aveva portato quel limite a 240. Secondo OpenAI, Astra ha contribuito a stabilire un limite più stretto: 186.
Il secondo riguarda i gap insolitamente grandi fra primi, dove il modello avrebbe migliorato un termine di un limite rimasto invariato per oltre ottant'anni. OpenAI dichiara di pubblicare le dimostrazioni e i materiali di verifica per entrambi.
Sono affermazioni straordinarie e vanno trattate come tali: non sono punteggi ma contributi a problemi aperti, e il loro valore dipende dalla verifica della comunità matematica. Ma se reggono, dicono qualcosa di diverso da qualunque benchmark — cioè che il modello ha prodotto conoscenza nuova, non solo risolto prove costruite per misurarlo.
Il quadro completo su matematica e scienze è in GPT-6 Astra per scienza e matematica.
Una nota su Gemini nelle tabelle
Nelle tabelle ufficiali di OpenAI compare una colonna Gemini 3.8 Flash, con punteggi su diversi benchmark.
Alla data di verifica di questa guida, però, quel modello non risulta elencato nella pagina modelli della documentazione Google, che si ferma a Gemini 3.6 Flash e Gemini 3.1 Pro. Non sappiamo se si tratti di una versione non ancora documentata pubblicamente, di un accesso anticipato o di una denominazione diversa.
Per questo, ovunque in questa guida citiamo quei numeri, lo facciamo come dati riportati da OpenAI e non come specifiche Google. È una distinzione che sembra pedante e non lo è: attribuire a un fornitore un dato pubblicato da un suo concorrente è il modo più rapido di scrivere qualcosa di non verificabile.
Conclusione
GPT-6 Astra è un modello di punta con distacchi reali e verificabili su uso del computer, compiti agentici, lavoro scientifico da terminale e ragionamento astratto. Su ARC-AGI-3 il salto è di un ordine di grandezza.
Ma non è il migliore ovunque, e OpenAI lo pubblica: su Artificial Analysis Intelligence Index, su Humanity's Last Exam e sull'indice di coding resta dietro ai modelli Claude. Il quadro utile è quindi specialistico, non assoluto.
Per un'azienda la domanda resta la stessa di sempre: il mio compito è in un'area dove questo vantaggio si vede? Se sì, vale la prova. Se no, esiste quasi sempre una fascia più bassa che fa lo stesso lavoro a molto meno.
Se vuoi capire quale modello ha senso per i tuoi processi e portarlo in produzione, Giallo Studio progetta agenti e automazioni AI su misura per le PMI.
Schema consigliato: Article + FAQPage + SoftwareApplication + BreadcrumbList
Risorse correlate
FAQ
Cos'è GPT-6 Astra?
È il modello di punta di OpenAI presentato come il più capace per il lavoro complesso da un capo all'altro. La scheda ufficiale indica 1.050.000 token di contesto, 128.000 token di output massimo e data limite della conoscenza al 30 aprile 2026.
Quanto costa GPT-6 Astra?
Sul piano Standard costa 10 dollari per milione di token in input e 50 in output. I prompt oltre 272.000 token vengono fatturati al doppio in input e a una volta e mezza in output sull'intera richiesta.
Chi può usarlo?
Secondo l'annuncio ufficiale è disponibile per ChatGPT Plus, Pro, Business ed Enterprise, oltre che via API OpenAI, Microsoft Azure e AWS Bedrock. Sugli account Enterprise è disattivato di default: deve abilitarlo un amministratore.
È il migliore su tutti i benchmark?
No, e le tabelle ufficiali di OpenAI lo mostrano. Su Artificial Analysis Intelligence Index e su Humanity's Last Exam resta dietro a Claude Fable 5.1, e sull'Artificial Analysis Coding Agent Index dietro a Claude Opus 5.
Supporta audio e video?
No. La scheda ufficiale indica testo in ingresso e in uscita e immagini solo in ingresso. Audio e video non sono supportati, e il fine-tuning non è disponibile.
Quali livelli di ragionamento ha?
Cinque: low, medium, high, xhigh e max. I punteggi pubblicati nelle tabelle ufficiali sono il massimo ottenuto a qualunque livello, quindi non sono confrontabili con esecuzioni a livello fisso.




