GPT-6 Astra vs Claude Opus 5.5: jak wypełnić kontekst 1M
Wrzesień 2026 przyniósł dwa nowe flagowe modele w odstępie trzech tygodni. OpenAI wypuściło GPT-6 Astra 3–4 września, a 22 września dołożyło lżejsze Sol i Luna. Tego samego dnia Anthropic wydał Claude Opus 5.5.
Większość porównań kończy się na tabeli benchmarków. To zadaje bardziej praktyczne pytanie, na które trafiasz w chwili, gdy naprawdę zaczynasz korzystać z okna na milion tokenów: co do niego włożyć i ile kosztuje jego wypełnienie?
Bo większe okno nie sprawi, że twoje źródła będą czystsze. Pozwoli ci po prostu zapłacić za więcej szumu.
Dwa okna obok siebie
Oto, co się liczy przy pracy z długim kontekstem, według opublikowanych specyfikacji i cenników z chwili pisania tego tekstu:
| Claude Opus 5.5 | GPT-6 Astra | |
|---|---|---|
| Okno kontekstu | 1,000,000 tokenów | 1,050,000 tokenów |
| Maks. wejście w jednym prompcie | 1,000,000 | ~922,000 (reszta zarezerwowana na wyjście) |
| Cena wejścia (za 1M tokenów) | $4 | $10 |
| Cena wyjścia (za 1M tokenów) | $20 | $50 |
| Dopłata za długi prompt | Brak, stała stawka | Całe żądanie liczone ~2× za wejście, 1.5× za wyjście powyżej 272K tokenów wejścia |
Rzucają się w oczy dwie rzeczy.
Po pierwsze, okno „większe” na papierze nie oznacza w praktyce większego promptu. Okno Astry jest o 5% większe, ale ponieważ jego część jest trzymana na wyjście, to Opus 5.5 przyjmuje większe pojedyncze wejście.
Po drugie, i ważniejsze dla twojego portfela: Astra ma próg cenowy przy 272K tokenów wejścia. Przekrocz go, a nowa stawka obejmie całe żądanie, nie tylko nadwyżkę. Prompt na 280K tokenów kosztuje mniej więcej dwa razy tyle, co prompt na 270K.
Ta jedna liczba zmienia sposób, w jaki warto przygotowywać dla niej kontekst.
Gdzie naprawdę idą tokeny
Powiedzmy, że chcesz, by model przeanalizował 40 stron internetowych: dokumentację konkurencji, kilka artykułów badawczych, parę wątków z forów. Naiwna droga to wkleić albo pobrać surowe strony.
Surowy HTML to w większości nie treść. To nawigacja, banery cookies, skrypty, style inline, atrybuty śledzące i linki w stopce powtarzane na każdej stronie. Artykuł na 5000 słów może jako HTML ważyć spokojnie 30 000–50 000 tokenów. Ten sam artykuł jako czysty Markdown jest zwykle o 80–90% mniejszy, często poniżej 7000 tokenów.
Przemnóż to przez 40 stron:
- Surowy HTML: ~1.4M tokenów. Nie mieści się w żadnym oknie. Zaczynasz wycinać strony.
- Czysty Markdown: ~250K tokenów. Mieści się w obu i zostaje poniżej progu 272K w Astrze.
Te same źródła, to samo pytanie. Jedna wersja w ogóle się nie uruchomi, druga działa na każdym z modeli, w cenie bazowej.
Szum kosztuje nie tylko pieniądze, ale i jakość odpowiedzi
Modele z długim kontekstem nauczyły się świetnie szukać igły w stogu siana. Nadal radzą sobie lepiej, gdy siana jest mniej.
Kiedy połowa promptu to menu i szablonowe fragmenty, cierpią trzy rzeczy:
- Przypisanie źródeł. Powtarzany tekst nawigacji i bloki „powiązane artykuły” tworzą fałszywe trafienia. Model cytuje pasek boczny zamiast artykułu.
- Struktura. HTML chowa hierarchię w gąszczu
divów. Markdown ją pokazuje: nagłówki#, listy, tabele i bloki kodu, które model czyta natywnie. - Ponowne użycie cache. Obaj dostawcy mocno obniżają cenę wejścia z cache. Czyste, stabilne pliki Markdown to dużo lepszy prefiks do cache niż strony, które przy każdym pobraniu zmieniają reklamy.
Prosta procedura do pracy z 1M tokenów
Tak pracujemy sami i działa to tak samo z oboma modelami:
- Zbieraj raz, jako Markdown. Gdy czytasz coś wartego zachowania, zapisz to jako plik
.md, a nie zakładkę. Z Minibase to jedno kliknięcie w Chrome: strona staje się czystym Markdownem z tytułem, adresem źródła i datą we frontmatterze. - Grupuj według projektu. Jeden folder na każde pytanie, nad którym pracujesz. Czterdzieści plików w folderze to gotowa paczka kontekstu.
- Policz, zanim wyślesz. Markdown pozwala liczyć uczciwie: rozmiar pliku podzielony mniej więcej przez cztery daje szacunkową liczbę tokenów. Jeśli celujesz w Astrę, trzymaj paczkę poniżej 272K.
- Podawaj paczkę, nie cały internet. Wskaż modelowi folder. Gdy Minibase Vault jest połączony z Claude, Claude czyta twoje zapisane pliki bezpośrednio przez MCP, bez kopiowania i wklejania.
- Zachowaj paczkę na następny raz. W przyszłym miesiącu, gdy wyjdzie kolejny model, ten sam folder zadziała bez zmian.
Który więc wybrać?
Przy badaniach na długim kontekście i pracy z dokumentami opublikowane liczby czynią z Opus 5.5 wygodniejszy domyślny wybór: stała cena w całym oknie, większy pojedynczy prompt i niższa stawka za token. Astra to mocny model z realnymi przewagami, zwłaszcza w computer use, i warto go używać, jeśli już pracujesz w ekosystemie OpenAI. Po prostu trzymaj prompty poniżej progu.
Ale uczciwy wniosek jest taki, że wybór modelu ma mniejsze znaczenie niż wybór wejścia. Oba okna nagradzają tę samą dyscyplinę: mniej tokenów, za to czystszych. Zespół z 250K tokenów dobrze ustrukturyzowanego Markdownu dostanie lepszą odpowiedź, szybciej i taniej, niż zespół wklejający 900K tokenów HTML-a do modelu, który akurat w tym tygodniu prowadzi w rankingu.
Modele zmieniają się co kilka miesięcy. Twoje źródła nie muszą.
Warto przeczytać
Continue reading
Dlaczego Markdown to najlepszy format dla LLM i agentów AI
Markdown zmniejsza zużycie tokenów nawet 10x względem HTML. Dowiedz się, czemu agenty AI i LLM wolą Markdown jako kontekst, i optymalizuj pracę.
Graph engineering: od pętli do grafów wiedzy
Graph engineering zaczął się w lipcu 2026 jako żart. Trzy znaczenia terminu i dlaczego wasz vault Markdown to już większość gotowego grafu.
Buzz Jacka Dorseya: agenci, Git i Markdown
Buzz od Block wpuszcza agentów AI na kanały zespołu z podpisaną tożsamością i Gitem w środku. Co wychodzi i dlaczego pamięć zostaje w Markdownie.
Jak Zbudować Bazę Wiedzy LLM za Pomocą Minibase
Zamień treści webowe w osobistą bazę wiedzy, dzięki której Claude, ChatGPT lub dowolny LLM stanie się mądrzejszy. Zainspirowane Karpathym.