GPT-6 Astra vs Claude Opus 5.5: riempire 1M di contesto
Settembre 2026 ci ha regalato due nuovi modelli di punta a tre settimane di distanza. OpenAI ha lanciato GPT-6 Astra il 3 e 4 settembre, poi ha aggiunto i più leggeri Sol e Luna il 22 settembre. Lo stesso giorno Anthropic ha rilasciato Claude Opus 5.5.
La maggior parte dei confronti si ferma alla tabella dei benchmark. Questo pone una domanda più pratica, quella che ti trovi davanti appena usi davvero una finestra da un milione di token: cosa ci metti dentro, e quanto costa riempirla?
Perché una finestra più grande non rende più pulite le tue fonti. Ti permette solo di pagare più rumore.
Le due finestre a confronto
Ecco cosa conta per il lavoro su contesti lunghi, secondo le specifiche pubblicate e i prezzi di listino al momento in cui scriviamo:
| Claude Opus 5.5 | GPT-6 Astra | |
|---|---|---|
| Finestra di contesto | 1.000.000 token | 1.050.000 token |
| Input massimo in un solo prompt | 1.000.000 | ~922.000 (il resto è riservato all’output) |
| Prezzo input (per 1M token) | $4 | $10 |
| Prezzo output (per 1M token) | $20 | $50 |
| Sovrapprezzo per prompt lunghi | Nessuno, tariffa fissa | Intera richiesta fatturata ~2× in input e 1,5× in output oltre 272K token di input |
Saltano all’occhio due cose.
La prima: la finestra “più grande” sulla carta non è il prompt più grande nella pratica. La finestra di Astra è più ampia del 5%, ma siccome una parte è tenuta da parte per l’output, è Opus 5.5 ad accettare l’input singolo più grande.
La seconda, più importante per il portafoglio: Astra ha uno scalino di prezzo a 272K token di input. Superalo e l’intera richiesta, non solo l’eccedenza, viene ricalcolata. Un prompt da 280K token costa all’incirca il doppio di uno da 270K.
Quel singolo numero cambia il modo in cui dovresti preparare il contesto per questo modello.
Dove finiscono davvero i token
Mettiamo che tu voglia far ragionare un modello su 40 pagine web: documentazione dei concorrenti, qualche articolo di ricerca, alcune discussioni da forum. La strada ingenua è incollare o scaricare le pagine grezze.
L’HTML grezzo è in gran parte non contenuto. È navigazione, banner dei cookie, script, stili inline, attributi di tracciamento e link del footer ripetuti su ogni pagina. Un articolo di 5.000 parole può pesare tranquillamente 30.000-50.000 token in HTML. Lo stesso articolo in Markdown pulito è di solito più piccolo dell’80-90%, spesso sotto i 7.000 token.
Moltiplica per 40 pagine:
- HTML grezzo: ~1,4M token. Non entra in nessuna delle due finestre. Cominci a tagliare pagine.
- Markdown pulito: ~250K token. Entra in entrambe, e resta sotto lo scalino di 272K di Astra.
Stesse fonti, stessa domanda. Una versione non parte nemmeno; l’altra gira su entrambi i modelli, a prezzo base.
Il rumore non costa solo soldi, costa risposte
I modelli a contesto lungo sono diventati bravissimi a trovare l’ago nel pagliaio. Ma funzionano ancora meglio quando c’è meno paglia.
Quando metà del prompt è fatta di menu e testo di contorno, peggiorano tre cose:
- Attribuzione. Il testo di navigazione ripetuto e i blocchi “articoli correlati” creano falsi riscontri. Il modello cita una barra laterale invece dell’articolo.
- Struttura. L’HTML nasconde la gerarchia in una zuppa di
div. Il Markdown la rende esplicita: titoli#, elenchi, tabelle e blocchi di codice che il modello legge in modo nativo. - Riuso della cache. Entrambi i fornitori scontano parecchio l’input in cache. File Markdown puliti e stabili fanno da prefisso di cache molto migliore rispetto a pagine che cambiano pubblicità a ogni caricamento.
Una routine semplice per lavorare con 1M di token
È il flusso che usiamo noi stessi, e funziona allo stesso modo con entrambi i modelli:
- Raccogli una volta, in Markdown. Quando leggi qualcosa che vale la pena tenere, salvalo come file
.mdinvece che come segnalibro. Con Minibase è un clic in Chrome: la pagina diventa Markdown pulito, con titolo, URL di origine e data nel frontmatter. - Raggruppa per progetto. Una cartella per ogni domanda su cui stai lavorando. Quaranta file in una cartella sono un pacchetto di contesto.
- Conta prima di inviare. Il Markdown rende il calcolo onesto: la dimensione del file divisa più o meno per quattro ti dà una stima dei token. Se punti ad Astra, tieni il pacchetto sotto i 272K.
- Dai al modello il pacchetto, non internet. Indirizza il modello alla cartella. Con Minibase Vault collegato a Claude, Claude legge direttamente i tuoi file salvati tramite MCP, senza copia e incolla.
- Conserva il pacchetto per la prossima volta. Il mese prossimo, quando uscirà il modello successivo, la stessa cartella funzionerà senza modifiche.
Quindi, quale usare?
Per la ricerca su contesti lunghi e il lavoro sui documenti, i numeri pubblicati fanno di Opus 5.5 la scelta predefinita più semplice: un prezzo fisso su tutta la finestra, il prompt singolo più grande e una tariffa per token più bassa. Astra è un modello forte con vantaggi reali, soprattutto nel computer use, e vale la pena usarlo se sei già sullo stack di OpenAI. Basta tenere i prompt sotto lo scalino.
Ma la conclusione onesta è che la scelta del modello conta meno della scelta dell’input. Entrambe le finestre premiano la stessa disciplina: meno token, più puliti. Il team con 250K token di Markdown ben strutturato otterrà una risposta migliore, più veloce e più economica del team che incolla 900K token di HTML nel modello in cima alla classifica di questa settimana.
I modelli cambiano ogni pochi mesi. Le tue fonti non devono per forza cambiare.
Letture correlate
Continue reading
Perché il Markdown è il Formato Migliore per LLM e Agenti AI
Il Markdown riduce i token fino a 10 volte rispetto all'HTML. Scopri perché gli agenti AI e gli LLM lo preferiscono per il contesto.
Graph engineering: dai loop ai grafi di conoscenza
Il graph engineering è nato da una battuta nel luglio 2026. I tre significati e perché il vostro vault Markdown ne costituisce già la parte maggiore.
Buzz di Jack Dorsey: agenti, Git e Markdown
Buzz di Block mette gli agenti IA nei canali del team con identità firmata e Git integrato. Cosa funziona e perché il Markdown custodisce la memoria.
Come Costruire una Base di Conoscenza per LLM con Minibase
Trasforma i contenuti web in una knowledge base personale che rende Claude o ChatGPT molto più intelligenti. Ispirato all'approccio di Karpathy.