GPT-6 Astra vs Claude Opus 5.5: como encher 1M de contexto

Setembro de 2026 trouxe dois novos modelos de ponta com três semanas de diferença. A OpenAI lançou o GPT-6 Astra em 3 e 4 de setembro, depois acrescentou os mais leves Sol e Luna em 22 de setembro. No mesmo dia, a Anthropic lançou o Claude Opus 5.5.

A maioria das comparações para na tabela de benchmarks. Esta faz uma pergunta mais prática, aquela que aparece no momento em que você realmente usa uma janela de um milhão de tokens: o que você coloca nela, e quanto custa enchê-la?

Porque uma janela maior não deixa suas fontes mais limpas. Ela só permite que você pague por mais ruído.

As duas janelas, lado a lado

Isto é o que importa para trabalho com contexto longo, segundo as especificações publicadas e os preços de tabela no momento em que escrevemos:

Claude Opus 5.5GPT-6 Astra
Janela de contexto1,000,000 tokens1,050,000 tokens
Entrada máxima em um prompt1,000,000~922,000 (o resto fica reservado para a saída)
Preço de entrada (por 1M de tokens)$4$10
Preço de saída (por 1M de tokens)$20$50
Sobretaxa para prompts longosNenhuma, preço fixoRequisição inteira cobrada ~2× na entrada, 1.5× na saída acima de 272K tokens de entrada

Duas coisas saltam aos olhos.

Primeiro, a janela “maior” no papel não é o maior prompt na prática. A janela do Astra é 5% maior, mas como uma parte fica reservada para a saída, é o Opus 5.5 que aceita a maior entrada única.

Segundo, e mais importante para o seu bolso: o Astra tem um degrau de preço em 272K tokens de entrada. Passou dele, e a requisição inteira, não só o excedente, muda de preço. Um prompt de 280K tokens custa mais ou menos o dobro de um prompt de 270K.

Esse único número muda a forma como você deve preparar o contexto para ele.

Para onde os tokens vão de verdade

Digamos que você queira que um modelo raciocine sobre 40 páginas web: documentação de concorrentes, alguns artigos de pesquisa, algumas threads de fórum. O caminho ingênuo é colar ou buscar as páginas brutas.

HTML bruto quase não é conteúdo. É navegação, banner de cookies, scripts, estilos inline, atributos de rastreamento e links de rodapé repetidos em cada página. Um artigo de 5,000 palavras pode facilmente pesar 30,000–50,000 tokens em HTML. O mesmo artigo em Markdown limpo costuma ser 80–90% menor, muitas vezes abaixo de 7,000 tokens.

Aplique isso a 40 páginas:

  • HTML bruto: ~1.4M tokens. Não cabe em nenhuma das duas janelas. Você começa a cortar páginas.
  • Markdown limpo: ~250K tokens. Cabe nas duas, e fica abaixo do degrau de 272K do Astra.

Mesmas fontes, mesma pergunta. Uma versão não roda; a outra roda em qualquer um dos modelos, pelo preço base.

Ruído não custa só dinheiro, custa respostas

Os modelos de contexto longo ficaram muito bons em achar uma agulha no palheiro. Mas continuam melhores quando há menos palha.

Quando metade do prompt é menu e texto repetitivo, três coisas pioram:

  • Atribuição. Texto de navegação repetido e blocos de “artigos relacionados” criam falsas correspondências. O modelo cita uma barra lateral em vez do artigo.
  • Estrutura. O HTML esconde a hierarquia numa sopa de div. O Markdown a mantém explícita: títulos com #, listas, tabelas e blocos de código que o modelo lê nativamente.
  • Reaproveitamento de cache. Os dois fornecedores dão um bom desconto na entrada em cache. Arquivos Markdown limpos e estáveis formam um prefixo de cache muito melhor do que páginas que trocam de anúncio a cada acesso.

Uma rotina simples para trabalhar com 1M de tokens

Este é o fluxo que nós mesmos usamos, e funciona igual com qualquer um dos dois modelos:

  1. Colete uma vez, em Markdown. Quando ler algo que vale guardar, salve como arquivo .md em vez de favorito. Com o Minibase é um clique no Chrome: a página vira Markdown limpo, com título, URL de origem e data no frontmatter.
  2. Agrupe por projeto. Uma pasta por pergunta em que você está trabalhando. Quarenta arquivos numa pasta formam um pacote de contexto.
  3. Conte antes de enviar. O Markdown deixa isso honesto: o tamanho do arquivo dividido por mais ou menos quatro dá uma estimativa de tokens. Se o alvo for o Astra, mantenha o pacote abaixo de 272K.
  4. Envie o pacote, não a internet. Aponte o modelo para a pasta. Com o Minibase Vault conectado ao Claude, o Claude lê seus arquivos salvos diretamente via MCP, sem copiar e colar.
  5. Guarde o pacote para a próxima vez. No mês que vem, quando sair o próximo modelo, a mesma pasta funciona sem mudar nada.

Então, qual usar?

Para pesquisa e trabalho com documentos em contexto longo, os números publicados fazem do Opus 5.5 a escolha padrão mais fácil: preço fixo em toda a janela, o maior prompt único e uma tarifa menor por token. O Astra é um modelo forte com vitórias reais, principalmente em computer use, e vale a pena usá-lo se você já está no ecossistema da OpenAI. Só mantenha seus prompts abaixo do degrau.

Mas a conclusão honesta é que a escolha do modelo importa menos do que a escolha da entrada. As duas janelas recompensam a mesma disciplina: menos tokens, e mais limpos. O time com 250K tokens de Markdown bem estruturado vai ter uma resposta melhor, mais rápida e mais barata do que o time que cola 900K tokens de HTML no modelo que liderou o ranking desta semana.

Os modelos mudam a cada poucos meses. Suas fontes não precisam mudar.

Leituras relacionadas

Continue reading

Pronto para salvar de forma mais inteligente?

Converta qualquer página da web em Markdown com um clique.

Adicionar ao Chrome