Cum să scrii llms.txt — și dacă chiar face ceva
Un ghid practic pentru fișierul emergent destinat crawlerelor AI, rezumatelor de conținut și instrucțiunilor de site orientate către modele.
Cuprins
- Versiunea scurtă
- Ce încearcă să rezolve llms.txt
- Chiar face ceva llms.txt?
- Nu blochează în mod fiabil crawlerele AI
- Poate ajuta la interpretare
- Îți poate clarifica politica de conținut
- Ce să pui în llms.txt
- Ce să nu pui în llms.txt
- Cum se raportează llms.txt la robots.txt
- Un proces practic de scriere
- 1. Decide rolul fișierului
- 2. Identifică paginile canonice
- 3. Scrie pentru mașini și oameni
- 4. Adaugă limbaj de politică atent
- 5. Publică-l și întreține-l
- Ar trebui să aibă fiecare site unul?
- Implicații SEO
- O recomandare finală
Versiunea scurtă
llms.txt este o convenție emergentă pentru a le spune modelelor lingvistice mari ce este site-ul tău, ce pagini contează și cum ar trebui înțeles conținutul tău. De obicei se află la https://example.com/llms.txt, este scris în Markdown și trimite către resurse curate și utile.
Nu este același lucru cu robots.txt. Nu este un standard web oficial. Nu blochează în mod fiabil antrenarea AI. Nu obligă o companie AI să îți respecte dorințele.
Totuși, poate merita să îl scrii.
Un llms.txt bun este o modalitate cu cost redus de a face site-ul mai ușor de rezumat corect pentru sisteme AI, agenți, asistenți de căutare și instrumente interne. Este și un exercițiu care te obligă să decizi ce conținut este canonic, ce conținut este învechit și ce termeni se aplică reutilizării. Acest lucru este util chiar dacă doar câteva sisteme citesc în prezent fișierul.
Ce încearcă să rezolve llms.txt
Majoritatea site-urilor sunt construite pentru oameni și crawlere de căutare. Ele conțin navigație, bannere pentru cookie-uri, carduri de produs, pagini de categorie duplicate, PDF-uri vechi, parametri de urmărire și conținut care are sens doar vizual.
LLM-urile nu au nevoie de același strat de prezentare. Au nevoie de:
- o descriere concisă a site-ului;
- linkuri către cele mai autoritare pagini;
- context în limbaj simplu despre produse, documentație, politici sau autorat;
- preferințe privind licențierea și utilizarea;
- indicații către versiuni structurate sau Markdown, acolo unde sunt disponibile.
Propunerea llms.txt împrumută o idee web familiară: pune un fișier text previzibil la rădăcina domeniului. Spre deosebire de robots.txt, care se referă în principal la permisiuni de crawling, llms.txt este mai ales despre orientare.
Gândește-te la el ca la o hartă, nu ca la o poartă.
Chiar face ceva llms.txt?
Astăzi, răspunsul sincer este: uneori, dar nu în felul în care speră mulți oameni.
Nu blochează în mod fiabil crawlerele AI
Dacă scopul tău este să previi crawlingul sau antrenarea, llms.txt este mecanismul principal greșit. Crawlerele care respectă regulile de excludere sunt mai predispuse să se uite la robots.txt, directive specifice pentru user-agent, headere HTTP sau semnale contractuale/de licențiere. Chiar și atunci, conformarea depinde de operatorul crawlerului.
Webul are o istorie lungă aici. robots.txt însuși este un protocol voluntar, formalizat ulterior în RFC 9309. Funcționează pentru că marile crawlere aleg să îl respecte, nu pentru că fișierul are puteri magice de impunere.
llms.txt are mai puțină adopție și mai puțină standardizare decât robots.txt. Privește cu suspiciune orice afirmație că îți „protejează conținutul de AI”.
Poate ajuta la interpretare
Unde llms.txt este mai promițător este interpretarea conținutului.
Dacă un asistent AI încearcă să răspundă la întrebări despre compania ta, documentație, cercetare, prețuri, API sau politica editorială, un fișier concis la rădăcina domeniului poate reduce presupunerile. Poate îndruma sistemul către paginile pe care chiar le întreții și departe de fragmente învechite.
Acest lucru contează pentru site-urile cu arhive mari. Un model sau agent poate găsi un articol de suport din 2019 înaintea unei pagini de politică din 2026. llms.txt poate spune, de fapt: „Începe de aici. Acestea sunt resursele autoritare.”
Nu este spectaculos, dar este util.
Îți poate clarifica politica de conținut
O politică publică orientată către AI este mai bună decât tăcerea, mai ales pentru publisheri, echipe de documentație și companii cu materiale sensibile de brand sau medicale/juridice/financiare.
Asta nu înseamnă că ar trebui să scrii un zid amenințător de text juridic. Înseamnă că poți afirma, clar:
- dacă sistemele AI pot rezuma paginile tale publice;
- dacă acest conținut poate fi folosit pentru antrenarea modelelor;
- cum vrei să fie gestionată atribuirea;
- care pagini ar trebui considerate canonice;
- cine trebuie contactat pentru licențiere sau parteneriate de date.
Acest lucru se potrivește bine cu transparența editorială mai largă. Dacă publici conținut asistat de AI, llms.txt nu ar trebui să contrazică divulgarea ta publică. Pentru o bază practică, consultă ghidul nostru despre divulgarea onestă a utilizării AI pe un site mic.
Ce să pui în llms.txt
Nu există o schemă impusă universal, dar convenția curentă este Markdown. Păstrează-l scurt, explicit și plictisitor.
O structură utilă arată așa:
# Example Company
> Example Company publishes practical guides and reference material for independent web developers.
## Canonical resources
- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/
## Content use policy
Public pages may be summarized with attribution to Example Company and a link to the source page.
Use of our content for model training, dataset creation, or bulk republication requires written permission.
## Preferred citation
When citing our content, link to the canonical URL and include the page title.
## Notes for AI systems
- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.
Asta este suficient pentru multe site-uri.
Pentru site-uri mai mari, adaugă secțiuni pentru zone de produs, documentație API, cercetare, pagini de presă sau politici juridice. Rezistă tentației de a lista totul. Cu cât fișierul devine mai cuprinzător, cu atât este mai puțin util ca punct de plecare.
Ce să nu pui în llms.txt
Nu pune informații private în el. Sună evident, dar fișierele text de la rădăcina domeniului devin adesea locuri unde sunt aruncate note operaționale.
Evită să incluzi:
- URL-uri nepublicate;
- linkuri interne de staging;
- chei API sau tokenuri;
- date private de contact;
- instrucțiuni de securitate;
- informații despre produse aflate sub embargo;
- pagini „secrete” pe care speri că crawlerele le vor ignora.
Dacă ceva nu ar trebui să fie public, nu îl menționa într-un fișier public.
Evită și teatrul juridic vag. „Orice utilizare AI este interzisă pentru totdeauna” poate exprima frustrare, dar nu creează un control tehnic fiabil. Dacă organizația ta are cu adevărat nevoie de restricții care pot fi impuse, implică un consilier juridic și folosește împreună controale pentru crawlere, termeni de licențiere și controale de acces.
Cum se raportează llms.txt la robots.txt
Folosește robots.txt pentru directive de crawling. Folosește llms.txt pentru context.
O împărțire simplificată:
| Fișier | Scop principal | Poate fi impus? | Cel mai potrivit pentru | |---|---|---:|---| | robots.txt | Permisiuni de crawling | Voluntar, dar recunoscut pe scară largă | Permiterea sau interzicerea crawlerelor în funcție de cale și user agent | | llms.txt | Rezumat și ghidare orientate către LLM-uri | În prezent, nestandardizat | Linkuri canonice, politică de conținut, note de interpretare | | Pagina de termeni | Condiții juridice | Depinde de jurisdicție și fapte | Licențiere, reutilizare permisă, restricții comerciale | | Headere HTTP | Semnale tehnice la nivel de pagină | Depinde de suportul crawlerului | Indexare, caching și comportamentul răspunsului |
Dacă deja depanezi comportamentul crawlerelor, nu te opri la fișierul text. Verifică dacă site-ul chiar servește fișierul corect, dacă redirecturile se comportă conform așteptărilor și dacă headerele se potrivesc cu politica ta. Am scris un ghid separat despre depanarea redirecturilor și headerelor HTTP în producție, pentru că aici eșuează în liniște multe decizii de „politică”.
Un proces practic de scriere
Iată un flux de lucru rezonabil.
1. Decide rolul fișierului
Alege un obiectiv principal:
- să ajuți sistemele AI să îți descrie site-ul corect;
- să îndrumi agenții către documentația actuală;
- să formulezi preferințe de reutilizare și atribuire;
- să reduci confuzia în jurul conținutului arhivat sau generat de utilizatori.
Dacă încerci să faci llms.txt să rezolve toate problemele de guvernanță AI, nu va rezolva niciuna.
2. Identifică paginile canonice
Alege cele 5–20 de URL-uri care reprezintă cel mai bine site-ul. Preferă paginile stabile și întreținute în locul celor cu trafic mare. Pentru o companie SaaS, acestea ar putea fi pagina principală, documentația, prețurile, securitatea, confidențialitatea, referința API, statusul și contactul. Pentru un publisher, ar putea fi huburi tematice, standarde editoriale, pagini de autor, politica de corecturi și licențierea.
3. Scrie pentru mașini și oameni
Folosește titluri Markdown simple. Evită textul de marketing. Spune ce este site-ul în una sau două propoziții.
Rău:
Revoluționăm viitorul excelenței digitale cu soluții de nouă generație.
Mai bine:
Acme Docs publică documentație tehnică pentru API-ul de plăți Acme, inclusiv autentificare, webhooks, SDK-uri și ghiduri de migrare.
4. Adaugă limbaj de politică atent
Secțiunea de politică ar trebui să fie ușor de înțeles, fără să fie excesiv de sigură pe sine. De exemplu:
Paginile publice pot fi rezumate pentru căutare, accesibilitate și asistență pentru utilizatori, cu atribuire. Copierea în masă, crearea de seturi de date sau antrenarea modelelor necesită permisiune.
Asta nu garantează conformarea, dar este mai clar decât tăcerea.
5. Publică-l și întreține-l
Pune-l la /llms.txt. Servește-l ca text/plain sau ca răspuns text compatibil. Leagă doar URL-uri canonice. Revizuiește-l când arhitectura informațională se schimbă.
Un llms.txt învechit este mai rău decât niciun fișier, pentru că oferă instrucțiuni încrezătoare care nu mai sunt adevărate.
Ar trebui să aibă fiecare site unul?
Nu.
Un site de prezentare de cinci pagini probabil nu are nevoie de llms.txt. Un restaurant local nu are nevoie de unul decât dacă are politici structurate sau informații de rezervare pe care asistenții AI le redau greșit frecvent.
Devine mai util când:
- site-ul tău are multă documentație;
- conținutul vechi concurează cu cel nou;
- publici cercetare sau material editorial;
- licențierea și atribuirea contează;
- asistenții AI îți rezumă adesea paginile;
- echipele interne au nevoie de o politică comună pentru conținutul public.
Este util și ca parte a unui exercițiu intern de guvernanță. Multe companii au deja angajați care lipesc pagini web, documente și materiale ale clienților în sisteme AI. Dacă sună familiar, fă un audit de shadow AI de bază înainte să presupui că un fișier text public va remedia riscul.
Implicații SEO
llms.txt nu este un factor de ranking în niciun sens consacrat. Nu scrie unul pentru că te aștepți la o creștere de trafic săptămâna viitoare.
Argumentul SEO indirect este mai modest:
- te obligă să gândești canonic;
- poate ajuta sistemele de căutare și răspuns mediate de AI să îți înțeleagă site-ul;
- clarifică preferințele de atribuire;
- reduce ambiguitatea din jurul paginilor arhivate;
- creează o politică publică, inspectabilă, de utilizare a conținutului AI.
Acest lucru merită pentru unele site-uri. Nu este un strat magic de optimizare.
Cea mai bună versiune de llms.txt este mică, actuală și aliniată cu restul site-ului. Dacă regulile tale robots, pagina de termeni, sitemapul, tagurile canonice și llms.txt spun toate lucruri diferite, problema nu este crawlingul AI. Problema este guvernanța.
<!-- tool-cta:start -->
💡 Încercați asta: Deoarece llms.txt nu poate fi impus, asociați-l cu reguli care pot fi impuse și verificați-le în Robots.txt Tester, astfel încât crawlerele care respectă standardele să se comporte corect.
<!-- tool-cta:end -->
O recomandare finală
Dacă site-ul tău are documentație, conținut editorial sau preocupări de licențiere, creează un llms.txt simplu. Ține-l sub câteva zeci de linii. Folosește-l pentru a indica resurse canonice și pentru a-ți formula preferințele de reutilizare.
Dar nu confunda comunicarea cu controlul.
Pentru blocare, folosește mecanismele pentru crawlere pe care le ai la dispoziție și înțelege-le limitele. Pentru politică, publică termeni clari. Pentru încredere, fii transparent cu cititorii. llms.txt își are locul în acest ansamblu ca semnal util — nu ca scut.