GPT-6 Astra vs Claude Opus 5.5: lấp đầy 1 triệu token
Tháng 9 năm 2026 mang đến hai mô hình chủ lực mới, cách nhau ba tuần. OpenAI ra mắt GPT-6 Astra vào ngày 3 và 4 tháng 9, rồi bổ sung hai phiên bản nhẹ hơn là Sol và Luna vào ngày 22 tháng 9. Cũng trong ngày đó, Anthropic phát hành Claude Opus 5.5.
Phần lớn các bài so sánh dừng lại ở bảng benchmark. Bài này đặt ra một câu hỏi thực tế hơn, câu hỏi bạn gặp ngay khi thực sự dùng một cửa sổ một triệu token: nên đưa gì vào đó, và lấp đầy nó tốn bao nhiêu?
Bởi vì cửa sổ lớn hơn không làm nguồn của bạn sạch hơn. Nó chỉ cho phép bạn trả tiền cho nhiều nhiễu hơn.
Hai cửa sổ, đặt cạnh nhau
Dưới đây là những gì quan trọng với công việc ngữ cảnh dài, theo thông số và bảng giá niêm yết tại thời điểm viết bài:
| Claude Opus 5.5 | GPT-6 Astra | |
|---|---|---|
| Cửa sổ ngữ cảnh | 1,000,000 token | 1,050,000 token |
| Đầu vào tối đa trong một prompt | 1,000,000 | ~922,000 (phần còn lại dành cho đầu ra) |
| Giá đầu vào (mỗi 1 triệu token) | $4 | $10 |
| Giá đầu ra (mỗi 1 triệu token) | $20 | $50 |
| Phụ phí prompt dài | Không có, giá cố định | Toàn bộ request tính ~2× giá đầu vào, 1.5× giá đầu ra khi vượt 272K token đầu vào |
Có hai điều nổi bật.
Thứ nhất, cửa sổ “lớn hơn” trên giấy không phải là prompt lớn hơn trong thực tế. Cửa sổ của Astra lớn hơn 5%, nhưng vì một phần được giữ lại cho đầu ra, Opus 5.5 mới là mô hình nhận được một đầu vào đơn lớn hơn.
Thứ hai, và quan trọng hơn với ví tiền của bạn: Astra có một bậc giá ở mức 272K token đầu vào. Vượt qua ngưỡng đó, toàn bộ request, chứ không chỉ phần vượt, bị tính lại giá. Một prompt 280K token tốn gần gấp đôi một prompt 270K token.
Chỉ một con số đó thôi đã thay đổi cách bạn nên chuẩn bị ngữ cảnh cho nó.
Token thực sự đi đâu
Giả sử bạn muốn một mô hình suy luận trên 40 trang web: tài liệu của đối thủ, vài bài nghiên cứu, một số chủ đề diễn đàn. Cách ngây thơ là dán hoặc tải về các trang thô.
HTML thô phần lớn không phải là nội dung. Đó là thanh điều hướng, banner cookie, script, style nội tuyến, thuộc tính theo dõi, và các liên kết chân trang lặp lại trên mọi trang. Một bài viết 5.000 từ dưới dạng HTML có thể dễ dàng nặng 30.000 đến 50.000 token. Cùng bài viết đó ở dạng Markdown sạch thường nhỏ hơn 80 đến 90%, nhiều khi dưới 7.000 token.
Nhân lên cho 40 trang:
- HTML thô: ~1.4 triệu token. Không vừa cửa sổ nào cả. Bạn bắt đầu phải cắt bớt trang.
- Markdown sạch: ~250K token. Vừa cả hai, và vẫn nằm dưới bậc 272K của Astra.
Cùng nguồn, cùng câu hỏi. Một phiên bản không chạy nổi; phiên bản kia chạy được trên cả hai mô hình, với giá gốc.
Nhiễu không chỉ tốn tiền, nó còn làm hỏng câu trả lời
Các mô hình ngữ cảnh dài đã trở nên rất giỏi trong việc mò kim đáy bể. Nhưng chúng vẫn làm tốt hơn khi bể ít rơm hơn.
Khi một nửa prompt là menu và nội dung rập khuôn, ba thứ bị suy giảm:
- Trích dẫn nguồn. Chữ điều hướng lặp lại và các khối “bài viết liên quan” tạo ra những kết quả khớp sai. Mô hình trích dẫn thanh bên thay vì bài viết.
- Cấu trúc. HTML giấu thứ bậc trong một mớ
div. Markdown giữ nó rõ ràng: tiêu đề#, danh sách, bảng và khối code mà mô hình đọc một cách tự nhiên. - Tái sử dụng cache. Cả hai nhà cung cấp đều giảm giá mạnh cho đầu vào đã cache. Các file Markdown sạch và ổn định là tiền tố cache tốt hơn nhiều so với những trang đổi quảng cáo mỗi lần tải.
Một quy trình đơn giản cho công việc 1 triệu token
Đây là quy trình chính chúng tôi đang dùng, và nó hoạt động y hệt với cả hai mô hình:
- Thu thập một lần, dưới dạng Markdown. Khi đọc được thứ gì đáng giữ, hãy lưu nó thành file
.mdthay vì bookmark. Với Minibase, chỉ cần một cú nhấp trong Chrome: trang web trở thành Markdown sạch, kèm tiêu đề, URL nguồn và ngày trong frontmatter. - Nhóm theo dự án. Mỗi câu hỏi bạn đang giải quyết là một thư mục. Bốn mươi file trong một thư mục là một gói ngữ cảnh.
- Đếm trước khi gửi. Markdown giúp việc này minh bạch: kích thước file chia cho khoảng bốn cho bạn ước lượng số token. Nếu nhắm tới Astra, hãy giữ gói dưới 272K.
- Đưa gói vào, chứ không phải cả internet. Chỉ cho mô hình tới thư mục. Khi Minibase Vault được kết nối với Claude, Claude đọc trực tiếp các file bạn đã lưu qua MCP, không cần sao chép dán.
- Giữ gói cho lần sau. Tháng sau, khi mô hình kế tiếp ra mắt, cùng thư mục đó vẫn dùng được nguyên vẹn.
Vậy nên dùng mô hình nào?
Với nghiên cứu ngữ cảnh dài và công việc tài liệu, các con số công bố khiến Opus 5.5 là lựa chọn mặc định dễ dàng hơn: giá cố định trên toàn cửa sổ, prompt đơn lớn hơn, và đơn giá mỗi token thấp hơn. Astra là một mô hình mạnh với những ưu thế thật sự, đặc biệt ở khả năng điều khiển máy tính, và đáng dùng nếu bạn đã ở trong hệ sinh thái của OpenAI. Chỉ cần giữ prompt dưới bậc giá.
Nhưng bài học thành thật là: chọn mô hình ít quan trọng hơn chọn đầu vào. Cả hai cửa sổ đều thưởng cho cùng một kỷ luật: ít token hơn, sạch hơn. Đội có 250K token Markdown được cấu trúc tốt sẽ nhận câu trả lời tốt hơn, nhanh hơn và rẻ hơn đội dán 900K token HTML vào bất kỳ mô hình nào đang đứng đầu bảng xếp hạng tuần này.
Mô hình thay đổi vài tháng một lần. Nguồn của bạn thì không cần phải thế.
Bài viết liên quan
Continue reading
Tại Sao Markdown Là Định Dạng Tốt Nhất Cho LLM và AI Agent
Markdown giảm lượng token lên đến 10 lần so với HTML. Tìm hiểu tại sao AI agent và LLM ưa thích Markdown cho context và cách tối ưu quy trình AI của bạn.
Graph engineering: từ vòng lặp đến đồ thị tri thức
Graph engineering khởi đầu từ một câu đùa tháng 7/2026. Ba nghĩa của thuật ngữ và vì sao vault Markdown của bạn đã là phần lớn đồ thị.
Buzz của Jack Dorsey: agent, Git và Markdown
Buzz của Block đưa agent AI vào kênh nhóm với danh tính đã ký và Git tích hợp. Điều nó làm đúng và vì sao Markdown mới giữ được trí nhớ.
Cách Xây Dựng Cơ Sở Kiến Thức LLM Với Minibase
Biến mọi nội dung web thành cơ sở kiến thức cá nhân giúp Claude, ChatGPT hay bất kỳ LLM nào thông minh hơn hẳn. Lấy cảm hứng từ cách của Karpathy.