Cara menulis llms.txt—dan apakah itu benar-benar berguna
Panduan praktis untuk file yang sedang berkembang bagi crawler AI, ringkasan konten, dan instruksi situs yang ditujukan untuk model.
Daftar isi
- Versi singkat
- Masalah yang ingin diselesaikan llms.txt
- Apakah llms.txt benar-benar berguna?
- Ini tidak secara andal memblokir crawler AI
- Ini dapat membantu interpretasi
- Ini dapat memperjelas kebijakan konten Anda
- Apa yang harus dimasukkan ke llms.txt
- Apa yang tidak boleh dimasukkan ke llms.txt
- Hubungan llms.txt dengan robots.txt
- Proses penulisan yang praktis
- 1. Tentukan tugas file tersebut
- 2. Identifikasi halaman kanonis
- 3. Tulis untuk mesin dan manusia
- 4. Tambahkan bahasa kebijakan dengan hati-hati
- 5. Publikasikan dan pelihara
- Apakah setiap situs harus memilikinya?
- Implikasi SEO
- Rekomendasi akhir
Versi singkat
llms.txt adalah konvensi yang sedang berkembang untuk memberi tahu model bahasa besar tentang apa situs Anda, halaman mana yang penting, dan bagaimana konten Anda sebaiknya dipahami. Biasanya file ini berada di https://example.com/llms.txt, ditulis dalam Markdown, dan menautkan ke sumber daya yang bersih dan berguna.
Ini tidak sama dengan robots.txt. Ini bukan standar web resmi. Ini tidak secara andal memblokir pelatihan AI. Ini tidak memaksa perusahaan AI untuk mengikuti keinginan Anda.
Namun, file ini tetap layak ditulis.
llms.txt yang baik adalah cara berbiaya rendah untuk membuat situs Anda lebih mudah dirangkum dengan benar oleh sistem AI, agen, asisten pencarian, dan alat internal. Ini juga menjadi pemaksa keputusan: Anda harus menentukan konten mana yang kanonis, konten mana yang sudah usang, dan ketentuan apa yang berlaku untuk penggunaan ulang. Itu berguna meskipun saat ini hanya beberapa sistem yang membaca file tersebut.
Masalah yang ingin diselesaikan llms.txt
Sebagian besar situs web dibuat untuk manusia dan crawler pencarian. Situs-situs itu memuat navigasi, banner cookie, kartu produk, halaman kategori duplikat, PDF lama, parameter pelacakan, dan konten yang hanya masuk akal secara visual.
LLM tidak membutuhkan lapisan presentasi yang sama. Mereka membutuhkan:
- deskripsi singkat tentang situs;
- tautan ke halaman yang paling otoritatif;
- konteks berbahasa sederhana tentang produk, dokumentasi, kebijakan, atau kepenulisan;
- preferensi lisensi dan penggunaan;
- petunjuk ke versi terstruktur atau Markdown jika tersedia.
Usulan llms.txt meminjam gagasan web yang sudah akrab: letakkan file teks yang dapat diprediksi di root domain. Berbeda dengan robots.txt, yang terutama berkaitan dengan izin crawl, llms.txt lebih banyak berkaitan dengan orientasi.
Anggap saja sebagai peta, bukan gerbang.
Apakah llms.txt benar-benar berguna?
Saat ini, jawaban jujurnya adalah: kadang-kadang, tetapi bukan dengan cara yang diharapkan banyak orang.
Ini tidak secara andal memblokir crawler AI
Jika tujuan Anda adalah mencegah crawling atau pelatihan, llms.txt adalah mekanisme utama yang keliru. Crawler yang menghormati aturan pengecualian lebih mungkin melihat robots.txt, direktif user-agent tertentu, header HTTP, atau sinyal kontraktual/lisensi. Meski begitu, kepatuhan bergantung pada operator crawler.
Web punya sejarah panjang dalam hal ini. robots.txt sendiri adalah protokol sukarela, yang kemudian diformalisasi dalam RFC 9309. Protokol itu berfungsi karena crawler besar memilih untuk menghormatinya, bukan karena file tersebut memiliki kekuatan penegakan ajaib.
llms.txt memiliki adopsi dan standardisasi yang lebih rendah daripada robots.txt. Perlakukan klaim apa pun bahwa file ini “melindungi konten Anda dari AI” dengan sikap skeptis.
Ini dapat membantu interpretasi
Bagian yang lebih menjanjikan dari llms.txt adalah interpretasi konten.
Jika asisten AI mencoba menjawab pertanyaan tentang perusahaan, dokumentasi, riset, harga, API, atau kebijakan editorial Anda, file singkat di tingkat root dapat mengurangi tebakan. File ini dapat mengarahkan sistem ke halaman yang benar-benar Anda pelihara dan menjauhkannya dari fragmen yang sudah usang.
Ini penting untuk situs dengan arsip besar. Sebuah model atau agen mungkin menemukan artikel dukungan tahun 2019 sebelum halaman kebijakan tahun 2026. llms.txt Anda dapat mengatakan, pada intinya: “Mulai di sini. Ini adalah sumber daya otoritatif.”
Itu tidak glamor, tetapi berguna.
Ini dapat memperjelas kebijakan konten Anda
Kebijakan publik yang ditujukan untuk AI lebih baik daripada diam, terutama bagi penerbit, tim dokumentasi, dan perusahaan dengan materi merek atau materi medis/hukum/keuangan yang sensitif.
Ini tidak berarti Anda harus menulis dinding teks hukum yang mengancam. Artinya, Anda dapat menyatakan dengan jelas:
- apakah sistem AI boleh merangkum halaman publik Anda;
- apakah konten Anda boleh digunakan untuk pelatihan model;
- bagaimana Anda ingin atribusi ditangani;
- halaman mana yang harus dianggap kanonis;
- siapa yang dapat dihubungi untuk lisensi atau kemitraan data.
Ini selaras dengan transparansi editorial yang lebih luas. Jika Anda menerbitkan konten berbantuan AI, llms.txt Anda tidak boleh bertentangan dengan pengungkapan publik Anda. Untuk dasar yang praktis, lihat panduan kami tentang pengungkapan AI yang jujur di situs web kecil.
Apa yang harus dimasukkan ke llms.txt
Tidak ada skema yang ditegakkan secara universal, tetapi konvensi saat ini adalah Markdown. Buatlah singkat, eksplisit, dan sederhana.
Struktur yang berguna terlihat seperti ini:
# Example Company
> Example Company publishes practical guides and reference material for independent web developers.
## Canonical resources
- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/
## Content use policy
Public pages may be summarized with attribution to Example Company and a link to the source page.
Use of our content for model training, dataset creation, or bulk republication requires written permission.
## Preferred citation
When citing our content, link to the canonical URL and include the page title.
## Notes for AI systems
- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.
Itu cukup untuk banyak situs.
Untuk situs yang lebih besar, tambahkan bagian untuk area produk, dokumentasi API, riset, halaman pers, atau kebijakan hukum. Tahan dorongan untuk mencantumkan semuanya. Semakin komprehensif file itu, semakin kurang berguna ia sebagai titik awal.
Apa yang tidak boleh dimasukkan ke llms.txt
Jangan memasukkan informasi pribadi ke dalamnya. Ini terdengar jelas, tetapi file teks di tingkat root sering menjadi tempat pembuangan catatan operasional.
Hindari menyertakan:
- URL yang belum dipublikasikan;
- tautan staging internal;
- kunci API atau token;
- detail kontak pribadi;
- instruksi keamanan;
- informasi produk yang masih embargo;
- halaman “rahasia” yang Anda harap akan diabaikan crawler.
Jika sesuatu tidak seharusnya publik, jangan menyebutkannya dalam file publik.
Hindari juga teater hukum yang samar. “Semua penggunaan AI dilarang selamanya” mungkin mengekspresikan frustrasi, tetapi itu tidak menciptakan kontrol teknis yang andal. Jika organisasi Anda benar-benar membutuhkan pembatasan yang dapat ditegakkan, libatkan penasihat hukum dan gunakan kontrol crawler, ketentuan lisensi, serta kontrol akses secara bersamaan.
Hubungan llms.txt dengan robots.txt
Gunakan robots.txt untuk direktif crawl. Gunakan llms.txt untuk konteks.
Pembagian sederhana:
| File | Tujuan utama | Dapat ditegakkan? | Paling baik digunakan untuk | |---|---|---:|---| | robots.txt | Izin crawl | Sukarela tetapi diakui secara luas | Mengizinkan atau melarang crawler berdasarkan path dan user agent | | llms.txt | Ringkasan dan panduan untuk LLM | Saat ini belum distandardisasi | Tautan kanonis, kebijakan konten, catatan interpretasi | | Halaman ketentuan | Syarat hukum | Bergantung pada yurisdiksi dan fakta | Lisensi, penggunaan ulang yang diizinkan, pembatasan komersial | | Header HTTP | Sinyal teknis tingkat halaman | Bergantung pada dukungan crawler | Pengindeksan, caching, dan perilaku respons |
Jika Anda sudah men-debug perilaku crawler, jangan berhenti pada file teks. Periksa apakah situs Anda benar-benar menyajikan file tersebut dengan benar, apakah pengalihan berperilaku seperti yang diharapkan, dan apakah header sesuai dengan kebijakan Anda. Kami menulis panduan terpisah tentang men-debug pengalihan dan header HTTP di produksi karena di sinilah banyak keputusan “kebijakan” diam-diam gagal.
Proses penulisan yang praktis
Berikut alur kerja yang masuk akal.
1. Tentukan tugas file tersebut
Pilih satu tujuan utama:
- membantu sistem AI mendeskripsikan situs Anda secara akurat;
- mengarahkan agen ke dokumentasi terkini;
- menyatakan preferensi penggunaan ulang dan atribusi;
- mengurangi kebingungan seputar konten arsip atau buatan pengguna.
Jika Anda mencoba membuat llms.txt menyelesaikan setiap masalah tata kelola AI, file itu tidak akan menyelesaikan apa pun.
2. Identifikasi halaman kanonis
Pilih 5–20 URL yang paling mewakili situs. Utamakan halaman yang stabil dan dipelihara daripada halaman dengan trafik tinggi. Untuk perusahaan SaaS, itu mungkin homepage, dokumentasi, harga, keamanan, privasi, referensi API, status, dan kontak. Untuk penerbit, itu mungkin hub topik, standar editorial, halaman penulis, kebijakan koreksi, dan lisensi.
3. Tulis untuk mesin dan manusia
Gunakan heading Markdown yang sederhana. Hindari copy pemasaran. Katakan apa situs itu dalam satu atau dua kalimat.
Buruk:
Kami merevolusi masa depan keunggulan digital dengan solusi generasi berikutnya.
Lebih baik:
Acme Docs menerbitkan dokumentasi teknis untuk API pembayaran Acme, termasuk autentikasi, webhooks, SDK, dan panduan migrasi.
4. Tambahkan bahasa kebijakan dengan hati-hati
Bagian kebijakan Anda harus dapat dipahami tanpa terlalu percaya diri. Misalnya:
Halaman publik boleh dirangkum untuk pencarian, aksesibilitas, dan bantuan pengguna dengan atribusi. Penyalinan massal, pembuatan dataset, atau pelatihan model memerlukan izin.
Itu tidak menjamin kepatuhan, tetapi lebih jelas daripada diam.
5. Publikasikan dan pelihara
Letakkan di /llms.txt. Sajikan sebagai text/plain atau respons teks yang kompatibel. Tautkan hanya ke URL kanonis. Tinjau saat arsitektur informasi Anda berubah.
llms.txt yang usang lebih buruk daripada tidak ada file, karena ia memberikan instruksi meyakinkan yang tidak lagi benar.
Apakah setiap situs harus memilikinya?
Tidak.
Situs brosur lima halaman mungkin tidak membutuhkan llms.txt. Restoran lokal tidak membutuhkannya kecuali memiliki kebijakan terstruktur atau informasi pemesanan yang sering keliru dinyatakan oleh asisten AI.
File ini menjadi lebih berguna ketika:
- situs Anda memiliki banyak dokumentasi;
- konten lama bersaing dengan konten baru;
- Anda menerbitkan materi riset atau editorial;
- lisensi dan atribusi penting;
- asisten AI sering merangkum halaman Anda;
- tim internal membutuhkan kebijakan bersama untuk konten publik.
Ini juga berguna sebagai bagian dari latihan tata kelola internal. Banyak perusahaan sudah memiliki karyawan yang menempelkan halaman web, dokumentasi, dan materi pelanggan ke sistem AI. Jika itu terdengar familier, jalankan audit shadow AI dasar sebelum berasumsi bahwa file teks publik akan memperbaiki risikonya.
Implikasi SEO
llms.txt bukan faktor peringkat dalam pengertian yang mapan. Jangan menulisnya karena Anda mengharapkan lonjakan trafik minggu depan.
Kasus SEO tidak langsungnya lebih sederhana:
- ini memaksa pemikiran kanonis;
- ini dapat membantu pencarian yang dimediasi AI dan sistem jawaban memahami situs Anda;
- ini memperjelas preferensi atribusi;
- ini mengurangi ambiguitas seputar halaman arsip;
- ini menciptakan kebijakan konten AI yang publik dan dapat diperiksa.
Itu berharga bagi sebagian situs. Ini bukan lapisan optimasi ajaib.
Versi terbaik dari llms.txt adalah kecil, mutakhir, dan selaras dengan bagian lain situs Anda. Jika aturan robots, halaman ketentuan, sitemap, tag kanonis, dan llms.txt Anda semuanya mengatakan hal yang berbeda, masalahnya bukan crawling AI. Masalahnya adalah tata kelola.
<!-- tool-cta:start -->
💡 Coba ini: Karena llms.txt tidak dapat ditegakkan, padukan dengan aturan yang dapat ditegakkan dan periksa aturan tersebut di Robots.txt Tester agar crawler yang mematuhi standar berperilaku dengan benar.
<!-- tool-cta:end -->
Rekomendasi akhir
Jika situs Anda memiliki dokumentasi, konten editorial, atau kekhawatiran lisensi, buat llms.txt yang sederhana. Jaga agar tetap di bawah beberapa lusin baris. Gunakan untuk menunjuk ke sumber daya kanonis dan menyatakan preferensi penggunaan ulang Anda.
Namun jangan samakan komunikasi dengan kontrol.
Untuk pemblokiran, gunakan mekanisme crawler yang tersedia bagi Anda dan pahami batasannya. Untuk kebijakan, publikasikan ketentuan yang jelas. Untuk kepercayaan, bersikaplah transparan kepada pembaca. llms.txt termasuk dalam rangkaian itu sebagai sinyal yang membantu—bukan sebagai perisai.