Vai al contenuto
Giallo

Fast mode di Claude Opus 5.5: cos'è, quanto costa e quando conviene

Cos'è la Fast mode di Claude Opus 5.5: stesso modello, testo fino a 2,5 volte più veloce, 8 e 40 dollari per milione di token. Quando conviene e quando è uno spreco.

Di

Aggiornato il

Tempo di lettura: 9 min

Fast mode di Claude Opus 5.5: cos'è e quando conviene

La Fast mode di Claude Opus 5.5 è la risposta a una domanda precisa: è lo stesso modello, ma il testo arriva prima? Sì. Anthropic la descrive esattamente così — stesso modello, testo che arriva prima, fino a 2,5 volte più veloce — e la prezza al doppio: 8 dollari per milione di token in ingresso e 40 in uscita, contro 4 e 20 della modalità standard.

Non è un modello diverso, non è un livello di ragionamento, non migliora le risposte. È una leva sulla velocità che ha senso in un caso solo: quando qualcuno sta aspettando. Dati verificati il 23 settembre 2026.

In sintesi

  • Stesso modello, testo fino a 2,5× più veloce.
  • Costa il doppio: 8 $ / 40 $ per milione di token.
  • Si attiva con /fast in Claude Code; richiede l'utilizzo extra.
  • In anteprima al lancio: dettagli soggetti a cambiare.
  • Conviene dove qualcuno aspetta; è uno spreco dove nessuno guarda.
  • Non sostituisce un prompt corto e un contesto pulito, che sono gratis.

Cosa fa e cosa non fa

Fast mode
Qualità delle risposte Invariata: stesso modello
Velocità del testo Fino a 2,5× secondo Anthropic
Prezzo per milione di token 8 $ input / 40 $ output
Dove Claude Code (/fast) e piattaforma per sviluppatori
Requisiti Utilizzo extra abilitato
Stato Anteprima al lancio

Il dettaglio da non confondere: la Fast mode agisce sulla velocità con cui esce il testo, non sul tempo di riflessione prima della prima parola. Quello dipende dal livello di ragionamento e dalla lunghezza del prompt, e si governa altrove — vedi i livelli di ragionamento di Opus 5.5 e tempo al primo token.

Quando conviene e quando no

Conviene quando

  • Lavori a botta e risposta in Claude Code e ogni attesa ti interrompe
  • Un assistente risponde a clienti o colleghi in tempo reale
  • Le risposte sono lunghe e la lettura progressiva conta
  • Il costo per interazione è piccolo rispetto al valore del tempo di chi aspetta

Non conviene quando

  • Il lavoro gira di notte o in lotto: nessuno guarda
  • La run è lunga e autonoma: il modello lavora, tu fai altro
  • Il volume è alto e il margine per compito è stretto
  • Il problema è l'attesa iniziale, non la velocità del testo

La regola è una: la Fast mode si paga per il tempo di una persona. Se non c'è una persona che aspetta, stai pagando il doppio per niente.

Il conto, su un caso reale

Prendi un assistente interno che risponde a 2.000 domande al giorno, con risposte da 400 token. In modalità standard l'output costa 20 dollari per milione di token: 2.000 × 400 = 800.000 token, cioè 16 dollari al giorno di output. In Fast mode il doppio: 32. La differenza è 16 dollari al giorno, circa 350 al mese.

La domanda non è se 350 euro sono tanti: è quanto vale, per chi usa l'assistente, ricevere la risposta in metà tempo. Per un team di dieci persone che lo usano tutto il giorno, probabilmente sì. Per un lotto di 2.000 documenti processati di notte, no, e non c'è discussione. Il metodo per fare questi conti è in prezzo per milione di token, spiegato.

Prima della Fast mode: le tre cose gratis

Prima di pagare il doppio, tre interventi che accorciano l'attesa e non costano nulla:

  1. Accorciare il prompt e il contesto. Il tempo prima della prima parola cresce con quello che mandi. Un prompt di sistema lungo il doppio del necessario è attesa regalata a ogni chiamata.
  2. Usare la cache per la parte di prompt che non cambia. A Opus 5.5 la lettura dalla cache costa 0,20 dollari per milione: la parte fissa diventa quasi gratis e più veloce.
  3. Abbassare il livello di ragionamento dove il compito è semplice. Meno riflessione, risposta prima.

Fatte queste tre, se l'attesa resta un problema e c'è una persona che aspetta, la Fast mode è la mossa giusta.

Il caso al confine: gli agenti che parlano con i clienti

C'è una zona grigia dove la decisione non è ovvia: gli assistenti automatici che rispondono a clienti o dipendenti. Nessuna persona dell'azienda aspetta, ma aspetta il cliente, e il suo tempo vale.

Tre criteri per decidere:

  • La risposta è lunga? Se sono due righe, la velocità del testo non si nota. Se è una spiegazione di venti righe, la lettura progressiva conta e la Fast mode si sente.
  • Il cliente può fare altro nel frattempo? In una chat sì; al telefono, con un assistente vocale, ogni secondo di silenzio è un problema, e lì la Fast mode è quasi obbligatoria.
  • Quanto vale una conversazione? Per un assistente che qualifica richieste commerciali il costo doppio è trascurabile rispetto al valore di un contatto. Per rispondere alle domande sull'orario di apertura, no.

Anche qui vale l'ordine: prima le tre cose gratis, poi la misura, poi la Fast mode solo dove l'attesa resta un problema. Per come si costruiscono questi assistenti — perimetro, controllo umano, registro — vedi agenti AI per aziende.

Anteprima: cosa vuol dire per chi fa i conti

Al lancio Anthropic presenta la Fast mode come anteprima di ricerca. In pratica: i prezzi, i requisiti e la disponibilità possono cambiare, e una funzione in anteprima può essere modificata senza il preavviso che si dà a una funzione stabile. Per un uso interattivo in Claude Code questo non è un problema. Per metterla dentro un sistema in produzione con un budget mensile, conviene aspettare che esca dall'anteprima, o almeno prevedere che il costo possa muoversi. Il quadro generale del modello e dei suoi prezzi è in Claude Opus 5.5: cos'è.

Esempi pratici

Studio tecnico, 4 persone, Modena. Lavorano in Claude Code su un gestionale interno, sessioni di pair programming lunghe. Ogni risposta li interrompeva per venti-trenta secondi. /fast durante le sessioni interattive, standard per le run lunghe che lanciano prima di pranzo. Il costo extra è sul lavoro interattivo soltanto, dove il tempo delle persone vale più della differenza di prezzo.

Azienda di servizi, help desk interno, Bergamo. Un assistente su Opus 5.5 risponde ai dipendenti su procedure e modulistica. La lamentela era "è lento". Prima di attivare la Fast mode hanno accorciato il prompt di sistema — che allegava l'intero manuale a ogni domanda — e messo in cache le istruzioni fisse. L'attesa è scesa abbastanza da non attivare la modalità veloce. Costo dell'intervento: zero.

Come misurare se serve davvero

La decisione sulla Fast mode è una delle poche in cui il dato si raccoglie in un giorno.

  1. Registra l'attesa percepita per una settimana: quanto passa fra l'invio e la risposta completa, sulle richieste reali, non su una prova.
  2. Separa le due componenti: il tempo prima della prima parola e il tempo di scorrimento del testo. Solo la seconda migliora con la Fast mode.
  3. Chiedi a chi usa lo strumento se l'attesa lo interrompe. È una domanda, non un sondaggio: la risposta è quasi sempre netta.
  4. Attiva la Fast mode per una settimana sullo stesso perimetro e confronta: attesa, costo, e — la cosa che conta — se le persone la usano di più.

Se il tempo di scorrimento era già breve, la Fast mode non cambia niente e il costo doppio è puro spreco. Se le risposte sono lunghe e qualcuno le legge mentre arrivano, la differenza si sente subito. Come si misura l'attesa in modo corretto — valore tipico e casi peggiori, non la media — è in tempo al primo token.

Errori da evitare

  • Attivarla ovunque "per fare prima". Raddoppia il costo dove nessuno guarda.
  • Aspettarsi risposte migliori. È lo stesso modello: cambia il tempo, non il contenuto.
  • Usarla per curare l'attesa iniziale. Quella dipende dal prompt e dal livello, non dalla velocità del testo.
  • Non controllare l'utilizzo extra. In Claude Code senza quella impostazione non si attiva.
  • Prendere per definitivi prezzi e dettagli. È un'anteprima: verifica la pagina ufficiale prima di metterla a budget.

Come applicarlo in azienda

  1. Separa i compiti in due liste: dove una persona aspetta, dove nessuno guarda.
  2. Sulla seconda lista la Fast mode è esclusa per definizione.
  3. Sulla prima, prova prima le tre cose gratis: prompt corto, cache, livello adeguato.
  4. Attiva la Fast mode solo dove l'attesa resta un problema, e misura il costo extra a fine mese.

Per il resto del lavoro in Claude Code — run lunghe, regole di stop, subagenti — vedi Opus 5.5 in Claude Code. Per il quadro del modello, Claude Opus 5.5: cos'è.

Conclusione

La Fast mode è uno strumento onesto: dice cosa fa — stesso modello, testo prima — e quanto costa — il doppio. La decisione è tutta nella domanda "c'è qualcuno che aspetta?". Se sì, e se hai già fatto le tre cose gratis, vale il prezzo. Se no, è un modo elegante per pagare due volte.

L'AI diventa utile quando entra nei processi. Giallo Studio aiuta PMI e team a costruire automazioni concrete, misurabili e sostenibili.

Come lo applichiamo in azienda

Risorse correlate

Servizi di consulenza AI e automazione dei processi

FAQ

Cos'è la Fast mode di Claude Opus 5.5?

Una modalità che fa arrivare il testo prima, fino a 2,5 volte più veloce secondo Anthropic, con lo stesso modello. Non cambia la qualità delle risposte: cambia il tempo in cui arrivano. È disponibile in Claude Code e sulla piattaforma per sviluppatori, in anteprima.

Quanto costa la Fast mode?

8 dollari per milione di token in ingresso e 40 in uscita, contro i 4 e 20 della modalità standard: il doppio. In Claude Code richiede l'utilizzo extra abilitato.

Come si attiva?

In Claude Code con il comando /fast. Sulla piattaforma per sviluppatori tramite il parametro dedicato: verifica la documentazione ufficiale, perché la modalità è in anteprima e i dettagli possono cambiare.

Quando conviene la Fast mode?

Quando qualcuno aspetta davanti allo schermo: lavoro a botta e risposta, sessioni interattive, assistenti che rispondono a persone. Non conviene per lotti notturni, run lunghe autonome e tutto ciò che nessuno guarda in tempo reale.

La Fast mode migliora i risultati?

No. Anthropic è esplicita: stesso modello, il testo arriva prima. Se i risultati non ti soddisfano, il problema è il prompt o il livello di ragionamento, non la velocità.

Fast mode e livelli di ragionamento sono la stessa cosa?

No. I livelli decidono quanto il modello pensa prima di rispondere; la Fast mode decide quanto velocemente esce il testo. Si possono combinare: un livello basso in Fast mode è la configurazione più reattiva possibile.

Applichiamolo

Trasformiamo la guida in un primo flusso live.

Raccontaci quale processo vuoi alleggerire: valutiamo fattibilita, ritorno e primo step operativo.