GPT-6 Astra vs. Claude Opus 5.5: 1M Kontext füllen

Der September 2026 hat uns im Abstand von drei Wochen zwei neue Flaggschiffe beschert. OpenAI brachte GPT-6 Astra am 3. und 4. September heraus und legte am 22. September die leichteren Modelle Sol und Luna nach. Am selben Tag veröffentlichte Anthropic Claude Opus 5.5.

Die meisten Vergleiche hören bei der Benchmark-Tabelle auf. Dieser hier stellt eine praktischere Frage, die sich in dem Moment stellt, in dem man ein Fenster mit einer Million Tokens wirklich nutzt: Was kommt hinein, und was kostet es, es zu füllen?

Denn ein größeres Fenster macht Ihre Quellen nicht sauberer. Es lässt Sie nur für mehr Rauschen bezahlen.

Die beiden Fenster im direkten Vergleich

Das zählt bei der Arbeit mit langem Kontext, laut den veröffentlichten Spezifikationen und Listenpreisen zum Zeitpunkt des Schreibens:

Claude Opus 5.5GPT-6 Astra
Kontextfenster1,000,000 Tokens1,050,000 Tokens
Maximaler Input pro Prompt1,000,000~922,000 (der Rest ist für den Output reserviert)
Input-Preis (pro 1M Tokens)$4$10
Output-Preis (pro 1M Tokens)$20$50
Aufschlag für lange PromptsKeiner, PauschalpreisGesamte Anfrage ab 272K Input-Tokens mit ~2× Input, 1.5× Output berechnet

Zwei Dinge fallen sofort auf.

Erstens ist das auf dem Papier „größere” Fenster in der Praxis nicht der größere Prompt. Das Fenster von Astra ist 5% größer, aber weil ein Teil davon für den Output reserviert bleibt, nimmt Opus 5.5 den größeren einzelnen Input an.

Zweitens, und wichtiger für Ihren Geldbeutel: Astra hat eine Preisstufe bei 272K Input-Tokens. Wer sie überschreitet, bekommt die gesamte Anfrage neu berechnet, nicht nur den Überhang. Ein Prompt mit 280K Tokens kostet ungefähr doppelt so viel wie einer mit 270K.

Diese eine Zahl verändert, wie Sie Kontext dafür vorbereiten sollten.

Wohin die Tokens tatsächlich gehen

Angenommen, ein Modell soll über 40 Webseiten hinweg nachdenken: Dokumentation von Mitbewerbern, ein paar Fachartikel, einige Forenthreads. Der naive Weg: die rohen Seiten einfügen oder abrufen.

Rohes HTML ist größtenteils kein Inhalt. Es besteht aus Navigation, Cookie-Bannern, Skripten, Inline-Styles, Tracking-Attributen und Footer-Links, die sich auf jeder Seite wiederholen. Ein Artikel mit 5,000 Wörtern kann als HTML leicht 30,000–50,000 Tokens wiegen. Derselbe Artikel als sauberes Markdown ist in der Regel 80–90% kleiner, oft unter 7,000 Tokens.

Hochgerechnet auf 40 Seiten:

  • Rohes HTML: ~1.4M Tokens. Passt in keines der beiden Fenster. Sie fangen an, Seiten zu streichen.
  • Sauberes Markdown: ~250K Tokens. Passt in beide und bleibt unter der 272K-Stufe von Astra.

Gleiche Quellen, gleiche Frage. Die eine Version läuft gar nicht, die andere auf beiden Modellen zum Grundpreis.

Rauschen kostet nicht nur Geld, sondern auch Antwortqualität

Modelle mit langem Kontext finden die Nadel im Heuhaufen inzwischen sehr zuverlässig. Mit weniger Heu sind sie trotzdem besser.

Wenn der halbe Prompt aus Menüs und Textbausteinen besteht, leiden drei Dinge:

  • Zuordnung. Wiederholte Navigationstexte und Blöcke mit „Ähnlichen Artikeln” erzeugen falsche Treffer. Das Modell zitiert die Seitenleiste statt des Artikels.
  • Struktur. HTML versteckt die Hierarchie in einer div-Suppe. Markdown hält sie explizit: #-Überschriften, Listen, Tabellen und Codeblöcke, die das Modell nativ liest.
  • Cache-Wiederverwendung. Beide Anbieter gewähren auf gecachten Input hohe Rabatte. Saubere, stabile Markdown-Dateien sind ein viel besseres Cache-Präfix als Seiten, die bei jedem Abruf andere Werbung zeigen.

Eine einfache Routine für Arbeit mit 1M Tokens

So arbeiten wir selbst, und es funktioniert mit beiden Modellen gleich:

  1. Einmal sammeln, als Markdown. Wenn Sie etwas lesen, das sich zu behalten lohnt, speichern Sie es als .md-Datei statt als Lesezeichen. Mit Minibase ist das ein Klick in Chrome: Die Seite wird zu sauberem Markdown mit Titel, Quell-URL und Datum im Frontmatter.
  2. Nach Projekt gruppieren. Ein Ordner pro Frage, an der Sie arbeiten. Vierzig Dateien in einem Ordner ergeben ein Kontextpaket.
  3. Vor dem Senden zählen. Markdown macht das ehrlich: Dateigröße geteilt durch etwa vier ergibt eine Token-Schätzung. Wenn Sie auf Astra zielen, bleiben Sie mit dem Paket unter 272K.
  4. Das Paket füttern, nicht das Internet. Verweisen Sie das Modell auf den Ordner. Ist Minibase Vault mit Claude verbunden, liest Claude Ihre gespeicherten Dateien direkt über MCP, ganz ohne Kopieren und Einfügen.
  5. Das Paket für das nächste Mal behalten. Wenn im nächsten Monat das nächste Modell erscheint, funktioniert derselbe Ordner unverändert.

Welches Modell also?

Für Recherche und Dokumentenarbeit mit langem Kontext machen die veröffentlichten Zahlen Opus 5.5 zur naheliegenden Standardwahl: ein einheitlicher Preis über das gesamte Fenster, der größere einzelne Prompt und ein niedrigerer Preis pro Token. Astra ist ein starkes Modell mit echten Stärken, vor allem bei Computer Use, und lohnt sich, wenn Sie ohnehin auf OpenAIs Stack arbeiten. Halten Sie Ihre Prompts nur unter der Stufe.

Die ehrliche Erkenntnis ist aber: Die Wahl des Modells zählt weniger als die Wahl des Inputs. Beide Fenster belohnen dieselbe Disziplin: weniger, sauberere Tokens. Ein Team mit 250K Tokens gut strukturiertem Markdown bekommt eine bessere Antwort, schneller und günstiger, als ein Team, das 900K Tokens HTML in das Modell kippt, das diese Woche zufällig die Rangliste anführt.

Modelle wechseln alle paar Monate. Ihre Quellen müssen das nicht.

Weiterlesen

Continue reading