Cách viết llms.txt—và liệu nó có thực sự có tác dụng không
Hướng dẫn thực tế về tệp đang nổi lên dành cho trình thu thập dữ liệu AI, bản tóm tắt nội dung và chỉ dẫn trang web hướng tới mô hình.
Mục lục
- Phiên bản ngắn gọn
- llms.txt nhằm giải quyết điều gì
- llms.txt có thực sự làm được gì không?
- Nó không chặn trình thu thập dữ liệu AI một cách đáng tin cậy
- Nó có thể giúp diễn giải nội dung
- Nó có thể làm rõ chính sách nội dung của bạn
- Nên đưa gì vào llms.txt
- Không nên đưa gì vào llms.txt
- llms.txt liên quan thế nào đến robots.txt
- Một quy trình viết thực tế
- 1. Quyết định nhiệm vụ của tệp
- 2. Xác định các trang chuẩn
- 3. Viết cho máy và con người
- 4. Thêm ngôn ngữ chính sách một cách cẩn trọng
- 5. Xuất bản và duy trì
- Có phải website nào cũng nên có không?
- Hàm ý SEO
- Khuyến nghị cuối cùng
Phiên bản ngắn gọn
llms.txt là một quy ước đang nổi lên để cho các mô hình ngôn ngữ lớn biết trang web của bạn là gì, những trang nào quan trọng và nội dung của bạn nên được hiểu như thế nào. Tệp này thường nằm tại https://example.com/llms.txt, được viết bằng Markdown và liên kết đến các tài nguyên sạch, hữu ích.
Nó không giống robots.txt. Nó không phải là một tiêu chuẩn web chính thức. Nó không chặn việc huấn luyện AI một cách đáng tin cậy. Nó không buộc một công ty AI phải làm theo mong muốn của bạn.
Tuy vậy, nó vẫn có thể đáng để viết.
Một llms.txt tốt là cách chi phí thấp để giúp các hệ thống AI, agent, trợ lý tìm kiếm và công cụ nội bộ tóm tắt trang web của bạn chính xác hơn. Nó cũng là một cơ chế buộc bạn phải quyết định: nội dung nào là bản chuẩn, nội dung nào đã lỗi thời và điều khoản nào áp dụng cho việc tái sử dụng. Điều đó vẫn hữu ích ngay cả khi hiện chỉ có một số ít hệ thống đọc tệp này.
llms.txt nhằm giải quyết điều gì
Phần lớn website được xây dựng cho con người và trình thu thập dữ liệu tìm kiếm. Chúng có điều hướng, banner cookie, thẻ sản phẩm, trang danh mục trùng lặp, PDF cũ, tham số theo dõi và nội dung chỉ có ý nghĩa khi nhìn bằng mắt.
LLM không cần cùng một lớp trình bày như vậy. Chúng cần:
- mô tả ngắn gọn về trang web;
- liên kết đến các trang có thẩm quyền nhất;
- ngữ cảnh bằng ngôn ngữ rõ ràng về sản phẩm, tài liệu, chính sách hoặc tác giả;
- ưu tiên về cấp phép và sử dụng;
- chỉ dẫn đến các phiên bản có cấu trúc hoặc Markdown nếu có.
Đề xuất llms.txt mượn một ý tưởng web quen thuộc: đặt một tệp văn bản có vị trí dự đoán được ở gốc tên miền. Khác với robots.txt, vốn chủ yếu nói về quyền thu thập dữ liệu, llms.txt chủ yếu nói về định hướng.
Hãy xem nó như một bản đồ, không phải một cánh cổng.
llms.txt có thực sự làm được gì không?
Hiện nay, câu trả lời trung thực là: đôi khi có, nhưng không theo cách nhiều người kỳ vọng.
Nó không chặn trình thu thập dữ liệu AI một cách đáng tin cậy
Nếu mục tiêu của bạn là ngăn thu thập dữ liệu hoặc huấn luyện, llms.txt không phải là cơ chế chính phù hợp. Các trình thu thập dữ liệu tôn trọng quy tắc loại trừ nhiều khả năng sẽ xem robots.txt, chỉ thị user-agent cụ thể, HTTP headers hoặc tín hiệu hợp đồng/cấp phép. Ngay cả khi đó, việc tuân thủ vẫn phụ thuộc vào đơn vị vận hành trình thu thập dữ liệu.
Web đã có lịch sử dài về việc này. Bản thân robots.txt là một giao thức tự nguyện, sau đó được chính thức hóa trong RFC 9309. Nó hoạt động vì các trình thu thập dữ liệu lớn chọn tôn trọng nó, không phải vì tệp đó có quyền lực thực thi kỳ diệu.
llms.txt có mức độ chấp nhận và chuẩn hóa thấp hơn robots.txt. Hãy thận trọng với mọi tuyên bố rằng nó “bảo vệ nội dung của bạn khỏi AI”.
Nó có thể giúp diễn giải nội dung
Nơi llms.txt hứa hẹn hơn là diễn giải nội dung.
Nếu một trợ lý AI đang cố trả lời câu hỏi về công ty, tài liệu, nghiên cứu, giá, API hoặc chính sách biên tập của bạn, một tệp ngắn gọn ở cấp gốc có thể giảm phỏng đoán. Nó có thể hướng hệ thống đến những trang bạn thực sự duy trì và tránh các mảnh nội dung đã lỗi thời.
Điều này quan trọng với các trang có kho lưu trữ lớn. Một mô hình hoặc agent có thể tìm thấy bài hỗ trợ năm 2019 trước trang chính sách năm 2026. llms.txt của bạn có thể nói, về bản chất: “Bắt đầu ở đây. Đây là các tài nguyên có thẩm quyền.”
Điều đó không hào nhoáng, nhưng hữu ích.
Nó có thể làm rõ chính sách nội dung của bạn
Một chính sách công khai hướng tới AI tốt hơn là im lặng, đặc biệt với nhà xuất bản, nhóm tài liệu và công ty có thương hiệu nhạy cảm hoặc tài liệu y tế/pháp lý/tài chính.
Điều này không có nghĩa bạn nên viết một bức tường văn bản pháp lý đầy đe dọa. Nó có nghĩa bạn có thể nêu rõ ràng:
- liệu hệ thống AI có thể tóm tắt các trang công khai của bạn hay không;
- liệu nội dung của bạn có thể được dùng để huấn luyện mô hình hay không;
- bạn muốn việc ghi nguồn được xử lý như thế nào;
- những trang nào nên được xem là bản chuẩn;
- liên hệ ai về cấp phép hoặc hợp tác dữ liệu.
Điều này kết hợp tốt với tính minh bạch biên tập rộng hơn. Nếu bạn xuất bản nội dung có AI hỗ trợ, llms.txt của bạn không nên mâu thuẫn với công bố công khai. Để có một nền tảng thực tế, hãy xem hướng dẫn của chúng tôi về công bố AI trung thực trên một website nhỏ.
Nên đưa gì vào llms.txt
Không có schema nào được thực thi phổ quát, nhưng quy ước hiện tại là Markdown. Hãy giữ tệp ngắn, rõ ràng và bình dị.
Một cấu trúc hữu ích trông như sau:
# Example Company
> Example Company publishes practical guides and reference material for independent web developers.
## Canonical resources
- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/
## Content use policy
Public pages may be summarized with attribution to Example Company and a link to the source page.
Use of our content for model training, dataset creation, or bulk republication requires written permission.
## Preferred citation
When citing our content, link to the canonical URL and include the page title.
## Notes for AI systems
- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.
Như vậy là đủ cho nhiều trang web.
Với các trang lớn hơn, hãy thêm phần cho khu vực sản phẩm, tài liệu API, nghiên cứu, trang báo chí hoặc chính sách pháp lý. Hãy cưỡng lại ý muốn liệt kê mọi thứ. Tệp càng toàn diện, nó càng kém hữu ích với vai trò điểm khởi đầu.
Không nên đưa gì vào llms.txt
Đừng đưa thông tin riêng tư vào đó. Điều này nghe có vẻ hiển nhiên, nhưng các tệp văn bản ở cấp gốc thường trở thành nơi gom các ghi chú vận hành.
Tránh đưa vào:
- URL chưa công bố;
- liên kết staging nội bộ;
- API keys hoặc tokens;
- thông tin liên hệ riêng tư;
- hướng dẫn bảo mật;
- thông tin sản phẩm còn bị cấm công bố;
- các trang “bí mật” mà bạn hy vọng trình thu thập dữ liệu sẽ bỏ qua.
Nếu thứ gì đó không nên công khai, đừng nhắc đến nó trong một tệp công khai.
Cũng nên tránh kiểu diễn kịch pháp lý mơ hồ. “Mọi việc sử dụng AI đều bị cấm vĩnh viễn” có thể thể hiện sự bức xúc, nhưng nó không tạo ra một biện pháp kiểm soát kỹ thuật đáng tin cậy. Nếu tổ chức của bạn thực sự cần các hạn chế có thể thực thi, hãy có tư vấn pháp lý và sử dụng kết hợp kiểm soát trình thu thập dữ liệu, điều khoản cấp phép và kiểm soát truy cập.
llms.txt liên quan thế nào đến robots.txt
Dùng robots.txt cho chỉ thị thu thập dữ liệu. Dùng llms.txt cho ngữ cảnh.
Một cách phân chia đơn giản:
| Tệp | Mục đích chính | Có thể thực thi? | Dùng tốt nhất cho | |---|---|---:|---| | robots.txt | Quyền thu thập dữ liệu | Tự nguyện nhưng được công nhận rộng rãi | Cho phép hoặc không cho phép trình thu thập dữ liệu theo đường dẫn và user agent | | llms.txt | Tóm tắt và hướng dẫn dành cho LLM | Hiện chưa được chuẩn hóa | Liên kết chuẩn, chính sách nội dung, ghi chú diễn giải | | Trang điều khoản | Điều kiện pháp lý | Phụ thuộc vào thẩm quyền tài phán và sự kiện cụ thể | Cấp phép, tái sử dụng được phép, hạn chế thương mại | | HTTP headers | Tín hiệu kỹ thuật cấp trang | Phụ thuộc vào hỗ trợ của trình thu thập dữ liệu | Lập chỉ mục, lưu bộ nhớ đệm và hành vi phản hồi |
Nếu bạn đang gỡ lỗi hành vi trình thu thập dữ liệu, đừng dừng lại ở tệp văn bản. Hãy kiểm tra xem trang của bạn có thực sự phục vụ tệp đúng cách không, redirect có hoạt động như kỳ vọng không và header có khớp với chính sách của bạn không. Chúng tôi đã viết một hướng dẫn riêng về gỡ lỗi redirect và HTTP headers trong production vì đây là nơi nhiều quyết định “chính sách” âm thầm thất bại.
Một quy trình viết thực tế
Đây là một workflow hợp lý.
1. Quyết định nhiệm vụ của tệp
Chọn một mục tiêu chính:
- giúp hệ thống AI mô tả trang web của bạn chính xác;
- hướng agent đến tài liệu hiện hành;
- nêu ưu tiên về tái sử dụng và ghi nguồn;
- giảm nhầm lẫn quanh nội dung lưu trữ hoặc do người dùng tạo.
Nếu bạn cố khiến llms.txt giải quyết mọi vấn đề quản trị AI, nó sẽ chẳng giải quyết được vấn đề nào.
2. Xác định các trang chuẩn
Chọn 5–20 URL đại diện tốt nhất cho trang web. Ưu tiên các trang ổn định, được duy trì hơn các trang có lưu lượng cao. Với một công ty SaaS, đó có thể là trang chủ, tài liệu, giá, bảo mật, quyền riêng tư, tài liệu tham chiếu API, trạng thái và liên hệ. Với một nhà xuất bản, đó có thể là trung tâm chủ đề, tiêu chuẩn biên tập, trang tác giả, chính sách đính chính và cấp phép.
3. Viết cho máy và con người
Dùng heading Markdown rõ ràng. Tránh lời quảng cáo. Nói trang web là gì trong một hoặc hai câu.
Chưa tốt:
Chúng tôi đang cách mạng hóa tương lai của sự xuất sắc số bằng các giải pháp thế hệ mới.
Tốt hơn:
Acme Docs xuất bản tài liệu kỹ thuật cho API thanh toán của Acme, bao gồm xác thực, webhooks, SDKs và hướng dẫn migration.
4. Thêm ngôn ngữ chính sách một cách cẩn trọng
Phần chính sách của bạn nên dễ hiểu mà không quá tự tin. Ví dụ:
Các trang công khai có thể được tóm tắt cho tìm kiếm, khả năng tiếp cận và hỗ trợ người dùng kèm ghi nguồn. Việc sao chép hàng loạt, tạo dataset hoặc huấn luyện mô hình cần có sự cho phép.
Điều đó không bảo đảm tuân thủ, nhưng rõ ràng hơn im lặng.
5. Xuất bản và duy trì
Đặt tệp tại /llms.txt. Phục vụ nó dưới dạng text/plain hoặc phản hồi văn bản tương thích. Chỉ liên kết đến URL chuẩn. Xem lại khi kiến trúc thông tin của bạn thay đổi.
Một llms.txt lỗi thời còn tệ hơn là không có tệp, vì nó đưa ra chỉ dẫn tự tin nhưng không còn đúng.
Có phải website nào cũng nên có không?
Không.
Một website brochure năm trang có lẽ không cần llms.txt. Một nhà hàng địa phương cũng không cần, trừ khi có chính sách có cấu trúc hoặc thông tin đặt chỗ mà trợ lý AI thường xuyên nói sai.
Nó trở nên hữu ích hơn khi:
- trang web của bạn có nhiều tài liệu;
- nội dung cũ cạnh tranh với nội dung mới;
- bạn xuất bản nghiên cứu hoặc tài liệu biên tập;
- cấp phép và ghi nguồn quan trọng;
- trợ lý AI thường tóm tắt các trang của bạn;
- nhóm nội bộ cần một chính sách chung cho nội dung công khai.
Nó cũng hữu ích như một phần của bài tập quản trị nội bộ. Nhiều công ty đã có nhân viên dán trang web, tài liệu và tài liệu khách hàng vào hệ thống AI. Nếu điều đó nghe quen thuộc, hãy thực hiện một kiểm toán shadow AI cơ bản trước khi cho rằng một tệp văn bản công khai sẽ xử lý được rủi ro.
Hàm ý SEO
llms.txt không phải là yếu tố xếp hạng theo bất kỳ nghĩa đã được xác lập nào. Đừng viết nó vì bạn kỳ vọng lưu lượng sẽ tăng vào tuần sau.
Lập luận SEO gián tiếp khiêm tốn hơn:
- nó buộc bạn suy nghĩ về bản chuẩn;
- nó có thể giúp tìm kiếm qua trung gian AI và hệ thống trả lời hiểu trang web của bạn;
- nó làm rõ ưu tiên ghi nguồn;
- nó giảm mơ hồ quanh các trang lưu trữ;
- nó tạo một chính sách sử dụng nội dung AI công khai, có thể kiểm tra.
Điều đó đáng giá với một số trang. Nó không phải là lớp tối ưu hóa kỳ diệu.
Phiên bản tốt nhất của llms.txt là nhỏ, hiện hành và nhất quán với phần còn lại của trang web. Nếu quy tắc robots, trang điều khoản, sitemap, thẻ canonical và llms.txt của bạn đều nói những điều khác nhau, vấn đề không phải là AI crawling. Vấn đề là quản trị.
<!-- tool-cta:start -->
💡 Hãy thử cách này: Vì llms.txt không thể bắt buộc thực thi, hãy kết hợp nó với các quy tắc có thể thực thi và kiểm tra chúng trong Robots.txt Tester để các trình thu thập dữ liệu tuân thủ tiêu chuẩn hoạt động đúng cách.
<!-- tool-cta:end -->
Khuyến nghị cuối cùng
Nếu trang web của bạn có tài liệu, nội dung biên tập hoặc mối quan tâm về cấp phép, hãy tạo một llms.txt đơn giản. Giữ nó dưới vài chục dòng. Dùng nó để trỏ đến tài nguyên chuẩn và nêu ưu tiên tái sử dụng của bạn.
Nhưng đừng nhầm lẫn giữa truyền đạt và kiểm soát.
Để chặn, hãy dùng các cơ chế trình thu thập dữ liệu bạn có và hiểu giới hạn của chúng. Với chính sách, hãy công bố điều khoản rõ ràng. Với niềm tin, hãy minh bạch với độc giả. llms.txt thuộc về bộ công cụ đó như một tín hiệu hữu ích—không phải một lá chắn.