Open Knowledge Format: Chuẩn Markdown Của Google Cho Agent
Ngày 12 tháng 6 năm 2026, Google Cloud công bố một đặc tả (spec) về cách các AI agent nên đọc và trao đổi kiến thức đã được chọn lọc. Bạn có thể hình dung ra một graph database, một schema registry, một SDK, và cả một service để chạy nó.
Nhưng không. Open Knowledge Format thực chất chỉ là: một thư mục chứa các file Markdown với YAML frontmatter.
Đó là toàn bộ định dạng. Và chính sự tiết chế đó mới là điều thú vị.
Spec Nhỏ Hơn Bạn Nghĩ
Hầu hết các bài viết về OKF chỉ tóm tắt lại thông báo. Nhưng đáng để đọc chính bản spec, vì phạm vi của nó nhỏ đến bất ngờ.
OKF v0.1 chỉ yêu cầu đúng một trường trên mỗi concept document:
---
type: BigQuery Table
---
Chỉ vậy thôi. type là một chuỗi ngắn xác định loại concept mà document mô tả, dùng để routing và filtering. Các giá trị này không được đăng ký tập trung — không có ủy ban nào duyệt danh sách type hợp lệ. Producer tự chọn một mô tả dễ hiểu rồi tiếp tục.
Năm trường khác được khuyến nghị, nhưng không bắt buộc:
| Trường | Mục đích |
|---|---|
title | Tên hiển thị. Consumer có thể tự suy ra từ tên file nếu thiếu. |
description | Tóm tắt trong một câu. |
resource | Một URI xác định duy nhất tài nguyên gốc. |
tags | Một danh sách YAML, dùng để phân loại chéo. |
timestamp | Ngày giờ ISO 8601 của lần sửa đổi cuối cùng. |
Producer có thể thêm bất kỳ key tùy chỉnh nào họ muốn. Consumer phải giữ nguyên các trường không xác định thay vì từ chối chúng.
Một concept document đầy đủ, tuân thủ spec, trông như sau:
---
type: BigQuery Table
title: Orders
description: One row per completed customer order.
resource: https://console.cloud.google.com/bigquery?p=acme&d=sales&t=orders
tags: [sales, orders]
timestamp: 2026-05-28T00:00:00Z
---
# Schema
| Column | Type | Description |
|--------|------|-------------|
| order_id | STRING | Unique identifier |
Nếu bạn từng viết một note trong Obsidian có frontmatter, thì bạn đã viết một thứ rất gần với một OKF concept hợp lệ.
Đồ Thị Tri Thức Không Cần Graph Database
Đây là quyết định thiết kế đáng để “đánh cắp” cho riêng mình, dù bạn có áp dụng OKF hay không.
Quan hệ giữa các concept được biểu diễn bằng link Markdown chuẩn. Không phải là edge trong một database. Không phải một block relationships: trong frontmatter. Chỉ là link:
Each order references a [customer](/tables/customers.md).
Đường dẫn tuyệt đối tương đối theo bundle (bắt đầu bằng /) được khuyến nghị để đảm bảo ổn định; đường dẫn tương đối thông thường như ./other.md cũng hoạt động tốt.
Và đây là phần khiến nó thực sự hiệu quả: loại quan hệ được thể hiện qua câu văn xung quanh, chứ không phải qua bản thân đường link. “Each order references a customer” chính là nhãn của edge. Không cần duy trì ontology, không cần thống nhất một bộ từ vựng predicate nào, vì ngôn ngữ tự nhiên vốn đã có sẵn một bộ như thế — và consumer ở đây là một language model.
Cả một thập kỷ công cụ knowledge-graph đã đổ vào việc hình thức hóa các loại quan hệ để máy có thể diễn giải chúng. Canh bạc của OKF là: điều đó giờ không còn cần thiết nữa — máy đã đọc được tiếng Anh rồi.
Hai Tên File Được Dành Riêng
Chỉ có hai tên file mang ý nghĩa đặc biệt bên trong một bundle:
index.md— một danh sách thư mục cho phép “tiết lộ dần” (progressive disclosure). Nó không có frontmatter. Agent đọc index trước, rồi chỉ đi theo những link nó cần, thay vì nạp toàn bộ concept vào context.log.md— lịch sử cập nhật theo trình tự thời gian, dùng tiêu đề ngày ISO 8601, mới nhất đứng trước.
Mọi file .md khác đều là một concept document. Một bundle cuối cùng trông như một thư mục bình thường, duyệt được:
sales/
├── index.md
├── datasets/orders_db.md
├── tables/orders.md
└── metrics/weekly_active_users.md
index.md mới là cái quan trọng một cách âm thầm. Đó cũng chính là bản năng đằng sau một CLAUDE.md được viết tốt: đừng đổ cả thư viện vào context window, hãy đưa cho agent một mục lục và để nó tự đi lấy.
OKF Không Phải Là Gì
Nó không phải RAG. RAG suy ra lại kiến thức ngay tại thời điểm truy vấn, bằng cách lấy các chunk thô rồi hy vọng những chunk liên quan sẽ nổi lên. Một OKF bundle lưu trữ các concept đã được chọn lọc, liên kết chéo với nhau, mà agent đọc và cập nhật trực tiếp. Việc chọn lọc diễn ra một lần, có chủ đích, thay vì bị xấp xỉ lại ở mỗi truy vấn.
Nó không phải AGENTS.md hay CLAUDE.md. Đó là các file hướng dẫn — chúng nói cho agent biết cách hành xử trong một repository. OKF mô tả kiến thức chuyên môn: bảng này nghĩa là gì, metric này được định nghĩa ra sao, vì sao dataset này có khoảng trống vào tháng Ba. Nhiệm vụ khác nhau, nhưng bổ trợ cho nhau.
Nó không phải MCP. MCP là một giao thức runtime để kết nối agent với các hệ thống đang chạy sống. OKF là một định dạng file nằm yên trên đĩa. Bạn hoàn toàn có thể dùng cả hai: MCP để chạm tới data warehouse, OKF để giải thích bên trong đó có gì.
Các Quy Tắc Tuân Thủ Được Thiết Kế Để Dễ Dãi
Một bundle tuân thủ OKF v0.1 nếu mọi file .md không thuộc diện dành riêng đều có YAML frontmatter parse được, mọi block frontmatter đều có type không rỗng, và các file dành riêng tuân theo đúng cấu trúc của chúng khi xuất hiện.
Điều đáng nói hơn là những gì spec cấm consumer làm. Một consumer không được từ chối một bundle chỉ vì thiếu trường tùy chọn, giá trị type lạ, key lạ, cross-link bị hỏng, hoặc thiếu index.md.
Đó là một định dạng được thiết kế bởi những người lường trước rằng bundle sẽ dở dang, một phần do máy sinh ra, và luôn trong trạng thái thay đổi — đúng như các knowledge base thực tế vẫn luôn trông như vậy. Các định dạng khắt khe thường chết vì chính sự khắt khe của mình. Cái này được xây để sống sót khi va chạm với một thư mục lộn xộn.
Google cũng phát hành công cụ tham chiếu đi kèm: một agent enrichment cho BigQuery, một trình visualizer HTML tĩnh, và ba bundle mẫu.
Một lưu ý cần nói thẳng: OKF hiện là v0.1, và được ghi rõ là bản draft. Spec có đánh version và được thiết kế để phát triển tương thích ngược, nhưng tên trường và quy ước vẫn có thể thay đổi. Đừng xây lại toàn bộ knowledge base của bạn theo nó ngay hôm nay. Nhưng hãy để ý xem chuẩn này đang đi theo hướng nào.
Vì Sao Điều Này Quan Trọng Vượt Ra Ngoài Google Cloud
Bỏ qua các ví dụ về BigQuery, OKF thực chất là một canh bạc có phạm vi ảnh hưởng rộng hơn nhiều: rằng định dạng bền vững cho kiến thức máy đọc được chính là các file Markdown thuần nằm trong một thư mục do bạn sở hữu.
Không phải một catalog độc quyền có API. Không phải embedding trong một vector store bạn không đọc được. Không phải một wiki với nút export làm hỏng bảng của bạn. Là file. Nằm trên đĩa. Diff được, grep được, di chuyển được giữa các vendor, đọc được bởi con người và bởi mọi model trên thị trường.
Đó cũng chính là kết luận mà Claude Code, Cursor, Copilot, và Windsurf đều đi đến một cách độc lập khi họ chọn Markdown làm định dạng instruction của mình. Việc Google Cloud viết nó thành một spec là sự xác nhận, không phải một phát minh mới.
Minibase Nằm Ở Đâu Trong Bức Tranh Này
Nếu bạn đang duy trì một Minibase Vault, thì bạn đã đang giữ một thứ có cấu trúc rất gần với một OKF bundle: một thư mục file Markdown có frontmatter, nằm trên đĩa của riêng bạn, được Claude và ChatGPT đọc.
Biến nó thành tuân thủ chính thức chỉ là một chỉnh sửa nhỏ — thêm type vào frontmatter, và để các link của bạn làm nốt phần còn lại:
---
type: Article
title: How the Open Knowledge Format can improve data sharing
resource: https://cloud.google.com/blog/products/data-analytics/how-the-open-knowledge-format-can-improve-data-sharing/
tags: [okf, agents, markdown]
timestamp: 2026-07-19T00:00:00Z
---
Đó là hình hài thực tế của thông báo này. Phần khó của một agent knowledge base chưa bao giờ là định dạng file — mà là đưa được nguồn tư liệu tốt vào trong đó. Một spec chỉ cho bạn cách định hình thư mục. Nó không lấp đầy thư mục đó.
Minibase chính là phần lấp đầy đó: chỉ một cú click biến bất kỳ trang web nào — tài liệu, một GitHub README, một spec, một thread, một bài nghiên cứu — thành Markdown sạch nằm trong thư mục của bạn, sẵn sàng cho agent tiếp theo mà bạn chạy.
Định dạng giờ đã là chuẩn. Những gì bạn đưa vào đó vẫn là lợi thế của riêng bạn.
Minibase biến bất kỳ trang web nào thành Markdown sạch mà agent của bạn có thể đọc được — cài extension và bắt đầu xây dựng bundle giúp agent của bạn thông minh hơn.
Continue reading
Cách Xây Dựng Cơ Sở Kiến Thức LLM Với Minibase
Biến mọi nội dung web thành cơ sở kiến thức cá nhân giúp Claude, ChatGPT hay bất kỳ LLM nào thông minh hơn hẳn. Lấy cảm hứng từ cách của Karpathy.
Markdown for Agents của Cloudflare: Ý Nghĩa Đối Với Web
Cloudflare giờ tự động chuyển mọi trang web sang Markdown cho AI agent, giảm 80% token. Ý nghĩa với web clipping và tương lai của internet.
AI Agent Dùng Obsidian Vault Của Bạn (MCP + Markdown)
Kết nối AI agent như Claude Code với Obsidian vault qua MCP. Biến ghi chú Markdown đã lưu thành ngữ cảnh giúp AI hiểu rõ công việc của bạn.
Autoresearch & PROGRAM.md của Karpathy Giải Thích
Autoresearch của Karpathy cho AI agent chạy hơn 100 thí nghiệm ML qua đêm, dẫn dắt bởi file Markdown tên program.md. Cách hoạt động và vì sao quan trọng.