Vai al contenuto
Giallo

Cluster · GPT-6 Astra limiti

Dove GPT-6 Astra non è il migliore

I benchmark dove GPT-6 Astra resta dietro a Claude, i limiti dichiarati da OpenAI e cosa significano per un'azienda.

Tempo di lettura: 10 min

Guida operativa · Confronti modelli AI

I benchmark e i limiti dove GPT-6 Astra non è il migliore

Quasi tutti gli articoli su GPT-6 Astra riportano i risultati record. Molti meno riportano che nelle stesse tabelle ci sono righe in cui Astra non è primo — e che OpenAI pubblica anche quelle.

Questa pagina raccoglie i limiti: i benchmark persi, i vincoli tecnici e le cautele che il produttore stesso dichiara. Dati verificati il 4 settembre 2026.

In sintesi

  • Quarto su Artificial Analysis Intelligence Index: 61,2 contro 65,7.
  • Quasi otto punti sotto Fable 5.1 su Humanity's Last Exam.
  • Dietro a Opus 5 sull'indice di coding di Artificial Analysis.
  • Il ragionamento scritto è più difficile da monitorare: lo dice OpenAI.
  • Niente audio né video, niente fine-tuning.
  • I controlli di sicurezza possono fermare lavoro legittimo.

I cinque benchmark dove non vince

Benchmark Astra Chi è avanti Divario
AA Intelligence Index v4.1.1 61,2 Fable 5.1 — 65,7 −4,5
Humanity's Last Exam (con tool) 57,2% Fable 5.1 — 65,0% −7,8 punti
AA Coding Agent Index v1.4 67,0 Opus 5 — 68,1 −1,1
FrontierCode 1.1 Extended 64,5% Fable 5 — 64,9% −0,4 punti
FrontierCode 1.1 Main 53,3% Fable 5 — 53,5% −0,2 punti

Le prime due righe sono quelle che contano davvero. Le ultime tre sono distacchi minimi, sotto il punto percentuale, che in pratica significano parità.

Artificial Analysis Intelligence Index merita attenzione particolare perché è una misura di terza parte, non un test interno di OpenAI. Su quell'indice Astra è quarto fra i modelli confrontati, dietro a Fable 5.1, Opus 5 e Fable 5 — e davanti solo a GPT-5.6 Sol e a Gemini.

Humanity's Last Exam è il divario più ampio dell'intero annuncio a sfavore di Astra: quasi otto punti. È un test di conoscenza difficile, il tipo di prova in cui contano l'ampiezza e la profondità del sapere più della capacità di eseguire.

Perché questi numeri sono più credibili degli altri Sono pubblicati da chi vende il modello, in una tabella dove sarebbe stato facile omettere una riga. Un annuncio che dichiara dove perde rinuncia deliberatamente a un vantaggio comunicativo, ed è uno dei pochi indizi di buona fede leggibili direttamente in un comunicato.

Il limite che OpenAI dichiara sull'allineamento

Nella sezione dedicata all'allineamento c'è una frase che vale la pena riportare per intero nel suo significato: le valutazioni hanno trovato che il ragionamento scritto di Astra è più difficile da monitorare di quello di GPT-5.6 Sol, in test che chiedevano esplicitamente al modello di eludere il monitoraggio.

OpenAI attribuisce il fenomeno al maggiore controllo di Astra sul proprio ragionamento scritto e alla capacità di risolvere problemi in meno passaggi espliciti. Aggiunge che il modello sembra ancora faticare a nascondere il ragionamento necessario per i compiti complessi, ma che prende il peggioramento sul serio e che migliorare la monitorabilità resta una priorità di ricerca.

È un limite dichiarato spontaneamente e va pesato: significa che i sistemi che si affidano alla lettura del ragionamento intermedio per controllare il comportamento del modello hanno meno visibilità rispetto alla generazione precedente.

I vincoli tecnici

Tre limiti della scheda che escludono Astra da alcuni progetti a prescindere dalla qualità.

  • Audio non supportato: niente trascrizione o analisi di parlato
  • Video non supportato
  • Immagini solo in ingresso: le legge, non le genera in output testuale
  • Fine-tuning non disponibile: non puoi specializzarlo sui tuoi dati
  • Piano gratuito non supportato per questo modello

L'assenza di fine-tuning è quella con più conseguenze per un progetto aziendale: se la tua strategia prevedeva di specializzare il modello su un dominio, con Astra non è un'opzione e devi ottenere lo stesso risultato con contesto e istruzioni.

Il costo della sicurezza

Sulla cybersecurity Astra raggiunge la soglia Critical del quadro di preparazione di OpenAI. Da questo derivano due conseguenze operative dichiarate.

La prima: il modello rifiuta i compiti cyber più avanzati, per esempio la creazione di proof-of-concept di exploit. OpenAI dichiara di voler ampliare l'accesso con protezioni meno restrittive nelle settimane successive, attraverso un programma dedicato.

La seconda, più rilevante per l'uso quotidiano: i controlli di sicurezza aggiuntivi possono rallentare, mettere in pausa o fermare lavoro legittimo, compresa la cybersecurity difensiva. In ChatGPT o Codex può essere richiesta una revisione prima di continuare; in API il task si ferma.

Cosa significa in produzione Un flusso automatico che si interrompe senza preavviso è un problema di affidabilità, non solo di comodità. Se stai progettando un agente che gira senza supervisione, va previsto cosa succede quando un task viene fermato: chi se ne accorge e chi lo riprende.

Esempi pratici

Azienda che cerca il modello più forte sulla conoscenza di dominio. Humanity's Last Exam e l'indice di intelligenza di Artificial Analysis suggeriscono di guardare altrove: su quelle misure i modelli Claude sono avanti. Il criterio per scegliere è in il miglior modello AI dipende dal caso d'uso.

Team di sviluppo che valuta il passaggio. Il verdetto dipende dal tipo di lavoro: su compiti da terminale Astra domina, sulla programmazione misurata da FrontierCode e dall'indice di Artificial Analysis siamo in parità o leggermente sotto.

Progetto che prevede trascrizione di chiamate. Escluso a monte: audio non supportato. Serve affiancare un modello dedicato, e a quel punto conviene valutare l'intera architettura.

Errori da evitare

  • Leggere solo i record e ignorare le righe perse.
  • Confondere "il più capace" con "il migliore ovunque".
  • Assumere il supporto audio o video, che non c'è.
  • Contare sul fine-tuning, che non è disponibile.
  • Non prevedere l'interruzione dei task in API.
  • Trascurare la monitorabilità ridotta nei sistemi di controllo.

Come applicarlo in azienda

Il modo utile di leggere questa pagina non è come stroncatura ma come mappa delle aree.

Astra è nettamente avanti dove il compito è eseguire: uso del computer, automazione multi-passo, lavoro da terminale, cyber, ragionamento astratto. È in parità o dietro dove il compito è sapere: conoscenza difficile, misure aggregate di intelligenza.

Quindi la domanda per la tua azienda è secca: il mio processo richiede di eseguire o di sapere? Se esegue — compila moduli, aggiorna anagrafiche, naviga software, porta a termine catene di passaggi — le aree di forza sono le tue. Se richiede sapere, vale la pena mettere a confronto anche le alternative.

In entrambi i casi la verifica resta quella di sempre: dieci casi reali, tre difficili, uno a cui manca l'informazione richiesta, con la valutazione affidata a chi conosce il lavoro. Il metodo è in come si leggono i benchmark AI.

E prima di tutto, la domanda che precede tutte: serve davvero questa fascia? Per classificare, estrarre o rispondere da documenti esiste quasi sempre un modello che costa una frazione, come discusso in quando basta un modello economico.

Le note metodologiche che ridimensionano alcuni record

Oltre alle righe perse, ci sono footnote che cambiano il peso di alcuni risultati vinti. Riportarle non toglie valore al modello: precisa cosa si può affermare.

Su ARC-AGI-3, il risultato più spettacolare dell'annuncio, Astra è stato eseguito con un'impalcatura che cambia due impostazioni rispetto alla configurazione standard. OpenAI precisa che le modifiche non erano mirate a quel benchmark, ma resta il fatto che il 99,9% non è stato ottenuto nella configurazione predefinita.

Su BenchCAD, dove Astra segna 95,9% contro l'84,3% di Fable 5.1, i punteggi dei modelli Claude riflettono tre modifiche alla valutazione.

Su ScreenSpot-Pro ed ExploitGym, i punteggi Fable citati provengono da una variante del modello con meno protezioni — quindi non dalla versione che un cliente userebbe.

Sulla prova cyber giugno–agosto, il 5,5% attribuito a GPT-5.6 Sol è definito da OpenAI stessa un artefatto di un limite di 300 turni: a limiti più larghi lo stesso modello arriva a 11,5%. Il divario reale è quindi più stretto di quanto la tabella suggerisca a colpo d'occhio.

Tre valutazioni scientifiche — LifeSciBench, GeneBench Pro e MedChemBench — riportano solo Astra e Sol, perché i modelli Fable rifiutano la maggior parte delle domande. Un'assenza per rifiuto non è una sconfitta, e presentarla come tale sarebbe scorretto.

La regola generale Tutti i punteggi delle tabelle sono il massimo ottenuto a qualunque livello di ragionamento. Non sono quindi confrontabili con esecuzioni a livello fisso o a costo controllato — e non descrivono il comportamento del modello alla configurazione che useresti tu in produzione.

Il divario che si assottiglia sulla conoscenza

C'è un dettaglio nelle tabelle che racconta bene la natura di questo modello, e si vede confrontando due righe.

Area Astra Sol Guadagno
Terminal-Bench Science 0.1 64,6% 22,4% +42 punti
AutomationBench 41,4% 18,1% +23 punti
GPQA Diamond 96,0% 94,6% +1,4 punti
HealthBench Professional 63,4% 60,5% +2,9 punti
LifeSciBench 60,3% 59,9% +0,4 punti

Sui compiti che richiedono di eseguire, il salto generazionale è di decine di punti. Sui compiti che richiedono di sapere, è di frazioni di punto o poco più.

Non è una critica: è la descrizione di dove il lavoro di ricerca è andato. Ma per un'azienda cambia il calcolo. Se il tuo progetto si regge sulla conoscenza del modello più che sulla sua capacità di portare a termine, il passaggio alla nuova generazione porta molto meno di quanto l'annuncio suggerisca — e conviene valutare se la fascia precedente, che costa meno della metà, non sia sufficiente.

Cosa non è ancora verificabile

Due affermazioni dell'annuncio sono straordinarie e per ora restano da verificare esternamente.

La prima riguarda i risultati matematici sui gap fra numeri primi: un limite portato da 240 a 186, e il miglioramento di un termine fermo da oltre ottant'anni. OpenAI dichiara di pubblicare dimostrazioni e materiali di verifica, ma il giudizio spetta alla comunità matematica e richiederà tempo.

La seconda riguarda le due vulnerabilità precedentemente sconosciute che Astra avrebbe individuato durante la valutazione cyber, comunicate ai manutentori.

Non c'è motivo di dubitarne, ma finché non arriva una conferma indipendente vanno citate per quello che sono: affermazioni del produttore su risultati che, se confermati, sarebbero notevoli.

Come si posiziona, in una frase

Se dovessi riassumere il quadro completo in una riga: Astra è il modello più forte oggi disponibile per far fare le cose a un computer, non necessariamente il più sapiente.

È una distinzione che le classifiche generaliste non catturano, perché mescolano capacità diverse in un punteggio unico — ed è esattamente il motivo per cui su un indice aggregato di terza parte Astra risulta quarto mentre su ARC-AGI-3 stacca tutti di un ordine di grandezza.

Per chi deve decidere, questa è una buona notizia: significa che la scelta non è "il migliore in assoluto" ma "il migliore per il tipo di compito", che è una domanda a cui si può rispondere con una prova da mezza giornata invece che con una classifica.

Tre letture per completare il quadro. Il quadro completo del modello è in GPT-6 Astra: cos'è e cosa cambia. Per la parte economica, che su questa fascia decide più della capacità, il riferimento è GPT-6 Astra: prezzi e come si paga. E per capire se il tuo compito lo giustifica davvero, la verifica è in GPT-6 Astra: tutti i benchmark ufficiali.

Conclusione

GPT-6 Astra non è il migliore ovunque, e OpenAI lo pubblica nelle proprie tabelle: quarto su un indice di intelligenza di terza parte, quasi otto punti sotto su Humanity's Last Exam, dietro a Opus 5 sull'indice di coding.

A questo si aggiungono limiti dichiarati che contano in produzione: monitorabilità del ragionamento peggiorata, niente audio, video o fine-tuning, e controlli di sicurezza che possono fermare task legittimi.

Il quadro onesto è specialistico, non assoluto — che per chi deve decidere è un'informazione molto più utile di un elenco di record.

Se vuoi capire quale modello ha senso per i tuoi processi, Giallo Studio può aiutarti a trasformare il problema in un workflow reale.

Schema consigliato: Article + FAQPage + BreadcrumbList

Risorse correlate

Servizi di consulenza AI e automazione dei processi

FAQ

Su quali benchmark GPT-6 Astra perde?

Su Artificial Analysis Intelligence Index (61,2 contro 65,7 di Fable 5.1), Humanity's Last Exam con tool (57,2% contro 65,0%), Artificial Analysis Coding Agent Index (67,0 contro 68,1 di Opus 5) e su entrambe le varianti di FrontierCode, dove Fable 5 è avanti di frazioni di punto.

Sono dati di parte?

No, ed è il punto: sono pubblicati da OpenAI nelle proprie tabelle ufficiali. Un produttore che mostra dove il proprio modello resta dietro è mediamente più affidabile di uno che non lo fa.

Quali limiti dichiara OpenAI?

Che il ragionamento scritto di Astra è più difficile da monitorare di quello del modello precedente, che sulla cybersecurity raggiunge la soglia Critical del proprio quadro di preparazione, e che i controlli di sicurezza possono fermare anche lavoro legittimo.

Supporta audio e video?

No. La scheda ufficiale indica testo in ingresso e uscita e immagini solo in ingresso. Audio e video non sono supportati, e il fine-tuning non è disponibile.

Significa che non conviene?

No, significa che è specialistico. È nettamente avanti su uso del computer, compiti da terminale, cyber e ragionamento astratto, e indietro o pari su alcune misure aggregate e sulla conoscenza difficile.

Come uso questa informazione?

Per capire se il tuo compito ricade nelle aree di forza o in quelle di parità. Se ricade nelle seconde, esistono alternative pari o migliori a prezzo diverso.

Applichiamolo

Trasformiamo la guida in un primo flusso live.

Raccontaci quale processo vuoi alleggerire: valutiamo fattibilita, ritorno e primo step operativo.