GPT-6 Astra vs Claude Opus 5.5 : remplir 1M de tokens

Septembre 2026 nous a offert deux nouveaux modèles phares à trois semaines d’intervalle. OpenAI a lancé GPT-6 Astra les 3 et 4 septembre, puis ajouté les versions plus légères Sol et Luna le 22 septembre. Le même jour, Anthropic sortait Claude Opus 5.5.

La plupart des comparatifs s’arrêtent au tableau des benchmarks. Celui-ci pose une question plus concrète, celle qu’on se prend en pleine figure dès qu’on utilise vraiment une fenêtre d’un million de tokens : qu’est-ce qu’on met dedans, et combien ça coûte de la remplir ?

Parce qu’une fenêtre plus grande ne rend pas vos sources plus propres. Elle vous permet juste de payer plus de bruit.

Les deux fenêtres, côte à côte

Voici ce qui compte pour le travail en contexte long, d’après les spécifications publiées et les prix catalogue au moment où j’écris :

Claude Opus 5.5GPT-6 Astra
Fenêtre de contexte1,000,000 tokens1,050,000 tokens
Entrée max en un seul prompt1,000,000~922,000 (le reste est réservé à la sortie)
Prix en entrée (par million de tokens)$4$10
Prix en sortie (par million de tokens)$20$50
Surcoût des prompts longsAucun, tarif fixeToute la requête facturée ~2× en entrée, 1.5× en sortie au-delà de 272K tokens d’entrée

Deux choses sautent aux yeux.

D’abord, la fenêtre la plus « grande » sur le papier n’est pas celle qui accepte le plus gros prompt en pratique. La fenêtre d’Astra est 5 % plus large, mais comme une partie est réservée à la sortie, c’est Opus 5.5 qui accepte la plus grosse entrée d’un seul tenant.

Ensuite, et c’est plus important pour votre portefeuille : Astra a un palier de prix à 272K tokens d’entrée. Franchissez-le et c’est toute la requête qui est refacturée, pas seulement le dépassement. Un prompt de 280K tokens coûte à peu près le double d’un prompt de 270K.

Ce seul chiffre change la façon dont vous devriez préparer le contexte.

Où partent vraiment les tokens

Imaginons que vous vouliez faire raisonner un modèle sur 40 pages web : la doc de concurrents, quelques articles de recherche, des fils de forum. La méthode naïve consiste à coller ou récupérer les pages brutes.

Le HTML brut, ce n’est pas du contenu pour l’essentiel. C’est de la navigation, des bandeaux de cookies, des scripts, des styles en ligne, des attributs de tracking et des liens de pied de page répétés sur chaque page. Un article de 5 000 mots peut facilement peser 30 000 à 50 000 tokens en HTML. Le même article en Markdown propre est en général 80 à 90 % plus léger, souvent sous les 7 000 tokens.

Appliquez ça à 40 pages :

  • HTML brut : ~1,4M de tokens. Ça ne rentre dans aucune des deux fenêtres. Vous commencez à couper des pages.
  • Markdown propre : ~250K tokens. Ça rentre dans les deux, et ça reste sous le palier des 272K d’Astra.

Mêmes sources, même question. Une version ne tourne pas ; l’autre tourne sur les deux modèles, au tarif de base.

Le bruit ne coûte pas que de l’argent, il coûte des réponses

Les modèles à contexte long sont devenus très bons pour trouver une aiguille dans une botte de foin. Ils restent meilleurs quand il y a moins de foin.

Quand la moitié du prompt, ce sont des menus et du texte passe-partout, trois choses se dégradent :

  • L’attribution. Le texte de navigation répété et les blocs « articles liés » créent de fausses correspondances. Le modèle cite une barre latérale au lieu de l’article.
  • La structure. Le HTML noie la hiérarchie dans une soupe de div. Le Markdown la garde explicite : titres en #, listes, tableaux et blocs de code, que le modèle lit nativement.
  • La réutilisation du cache. Les deux éditeurs font une grosse remise sur les entrées en cache. Des fichiers Markdown propres et stables font un bien meilleur préfixe de cache que des pages dont les pubs changent à chaque chargement.

Une routine simple pour travailler avec 1M de tokens

C’est le workflow que nous utilisons nous-mêmes, et il marche pareil avec les deux modèles :

  1. Collecter une fois, en Markdown. Quand vous lisez quelque chose qui mérite d’être gardé, enregistrez-le en fichier .md plutôt qu’en favori. Avec Minibase, c’est un clic dans Chrome : la page devient du Markdown propre, avec le titre, l’URL source et la date dans le frontmatter.
  2. Regrouper par projet. Un dossier par question sur laquelle vous travaillez. Quarante fichiers dans un dossier, c’est un pack de contexte.
  3. Compter avant d’envoyer. Le Markdown rend le calcul honnête : la taille du fichier divisée par quatre environ donne une estimation en tokens. Si vous visez Astra, gardez le pack sous 272K.
  4. Donner le pack, pas Internet. Pointez le modèle vers le dossier. Avec Minibase Vault connecté à Claude, Claude lit directement vos fichiers enregistrés via MCP, sans copier-coller.
  5. Garder le pack pour la prochaine fois. Le mois prochain, quand le prochain modèle sortira, le même dossier marchera tel quel.

Alors, lequel choisir ?

Pour la recherche en contexte long et le travail sur documents, les chiffres publiés font d’Opus 5.5 le choix par défaut le plus simple : un prix fixe sur toute la fenêtre, le plus gros prompt possible et un tarif au token plus bas. Astra est un modèle solide avec de vrais points forts, notamment en computer use, et il vaut le coup si vous êtes déjà sur la stack d’OpenAI. Gardez simplement vos prompts sous le palier.

Mais la leçon honnête, c’est que le choix du modèle compte moins que le choix de ce qu’on lui donne. Les deux fenêtres récompensent la même discipline : moins de tokens, plus propres. L’équipe qui arrive avec 250K tokens de Markdown bien structuré obtiendra une meilleure réponse, plus vite et moins cher, que celle qui colle 900K tokens de HTML dans le modèle en tête du classement de la semaine.

Les modèles changent tous les quelques mois. Vos sources, elles, n’ont pas besoin de changer.

À lire aussi

Continue reading

Prêt à sauvegarder plus intelligemment ?

Convertissez n'importe quelle page web en Markdown en un clic.

Ajouter à Chrome