SEO & Discoverability

Kako napisati llms.txt — i radi li zapravo išta

Praktičan vodič za novu datoteku namijenjenu AI crawlerima, sažecima sadržaja i uputama za web-mjesto okrenutima modelima.

The Wux Webtools Team The Wux Webtools Team 9 min čitanja Pomoć AI, pregledano od strane ljudi
Abstract illustration of an llms.txt file guiding AI crawler paths through a website structure.
Sadržaj
  1. Kratka verzija
  2. Što llms.txt pokušava riješiti
  3. Radi li llms.txt zapravo išta?
  4. Ne blokira pouzdano AI crawlere
  5. Može pomoći s tumačenjem
  6. Može razjasniti vašu politiku sadržaja
  7. Što staviti u llms.txt
  8. Što ne stavljati u llms.txt
  9. Kako se llms.txt odnosi prema robots.txt
  10. Praktičan proces pisanja
  11. 1. Odredite posao datoteke
  12. 2. Identificirajte kanonske stranice
  13. 3. Pišite za strojeve i ljude
  14. 4. Pažljivo dodajte jezik politike
  15. 5. Objavite ga i održavajte
  16. Treba li ga imati svako web-mjesto?
  17. SEO implikacije
  18. Završna preporuka

Kratka verzija

llms.txt je nova konvencija za objašnjavanje velikim jezičnim modelima što je vaše web-mjesto, koje su stranice važne i kako vaš sadržaj treba razumjeti. Obično se nalazi na https://example.com/llms.txt, piše se u Markdownu i povezuje na čiste, korisne resurse.

Nije isto što i robots.txt. Nije službeni web-standard. Ne blokira pouzdano AI treniranje. Ne prisiljava AI tvrtku da poštuje vaše želje.

Ipak, može ga vrijediti napisati.

Dobar llms.txt je jeftin način da vaše web-mjesto bude lakše ispravno sažeti za AI sustave, agente, pomoćnike za pretraživanje i interne alate. Ujedno je i prisila na razjašnjavanje: morate odlučiti koji je sadržaj kanonski, koji je zastario i koji se uvjeti primjenjuju na ponovnu upotrebu. To je korisno čak i ako datoteku trenutačno čita tek nekoliko sustava.

Što llms.txt pokušava riješiti

Većina web-mjesta izgrađena je za ljude i tražilice. Sadrže navigaciju, bannere za kolačiće, kartice proizvoda, duplicirane kategorijske stranice, stare PDF-ove, parametre za praćenje i sadržaj koji ima smisla samo vizualno.

LLM-ovima ne treba isti prezentacijski sloj. Trebaju im:

  • sažet opis web-mjesta;
  • poveznice na najautoritativnije stranice;
  • kontekst jednostavnim jezikom o proizvodima, dokumentaciji, pravilima ili autorstvu;
  • licenciranje i preferencije upotrebe;
  • upute prema strukturiranim ili Markdown verzijama gdje su dostupne.

Prijedlog llms.txt posuđuje poznatu web-ideju: stavite predvidljivu tekstnu datoteku u korijen domene. Za razliku od robots.txt, koji se primarno odnosi na dopuštenja za indeksiranje, llms.txt uglavnom služi orijentaciji.

Zamislite ga kao kartu, ne kao vrata.

Radi li llms.txt zapravo išta?

Danas je iskren odgovor: ponekad, ali ne onako kako se mnogi nadaju.

Ne blokira pouzdano AI crawlere

Ako vam je cilj spriječiti crawling ili treniranje, llms.txt je pogrešan primarni mehanizam. Crawleri koji poštuju pravila izuzimanja vjerojatnije će gledati robots.txt, posebne direktive za user-agent, HTTP zaglavlja ili ugovorne/licencne signale. Čak i tada, usklađenost ovisi o operatoru crawlera.

Web ovdje ima dugu povijest. Sam robots.txt dobrovoljni je protokol, poslije formaliziran u RFC 9309. Funkcionira zato što ga veliki crawleri odlučuju poštovati, a ne zato što datoteka ima čarobnu provedbenu moć.

llms.txt ima manju prihvaćenost i slabiju standardizaciju od robots.txt. Svaku tvrdnju da „štiti vaš sadržaj od AI-ja” treba promatrati sa skepsom.

Može pomoći s tumačenjem

Ondje gdje je llms.txt obećavajući jest tumačenje sadržaja.

Ako AI pomoćnik pokušava odgovoriti na pitanja o vašoj tvrtki, dokumentaciji, istraživanju, cijenama, API-ju ili uredničkoj politici, sažeta datoteka na razini korijena može smanjiti nagađanje. Može usmjeriti sustav prema stranicama koje stvarno održavate i dalje od zastarjelih fragmenata.

To je važno za web-mjesta s velikim arhivima. Model ili agent može pronaći članak podrške iz 2019. prije stranice s pravilima iz 2026. Vaš llms.txt može, u praksi, reći: „Počni ovdje. Ovo su autoritativni resursi.”

To nije glamurozno, ali je korisno.

Može razjasniti vašu politiku sadržaja

Javna politika namijenjena AI sustavima bolja je od šutnje, osobito za izdavače, timove za dokumentaciju i tvrtke s osjetljivim brendom ili medicinskim/pravnim/financijskim materijalom.

To ne znači da biste trebali napisati prijeteći zid pravnog teksta. Znači da možete jasno navesti:

  • smiju li AI sustavi sažimati vaše javne stranice;
  • smije li se vaš sadržaj upotrebljavati za treniranje modela;
  • kako želite da se navodi atribucija;
  • koje stranice treba smatrati kanonskima;
  • kome se obratiti za licenciranje ili podatkovna partnerstva.

To se dobro nadopunjuje sa širom uredničkom transparentnošću. Ako objavljujete sadržaj potpomognut AI-jem, vaš llms.txt ne bi smio proturječiti vašoj javnoj objavi. Za praktičnu osnovu pogledajte naš vodič za iskreno otkrivanje upotrebe AI-ja na malom web-mjestu.

Što staviti u llms.txt

Ne postoji univerzalno provedena shema, ali trenutačna konvencija je Markdown. Neka bude kratko, izričito i dosadno.

Korisna struktura izgleda ovako:

# Example Company

> Example Company publishes practical guides and reference material for independent web developers.

## Canonical resources

- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/

## Content use policy

Public pages may be summarized with attribution to Example Company and a link to the source page.

Use of our content for model training, dataset creation, or bulk republication requires written permission.

## Preferred citation

When citing our content, link to the canonical URL and include the page title.

## Notes for AI systems

- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.

To je dovoljno za mnoga web-mjesta.

Za veća web-mjesta dodajte odjeljke za područja proizvoda, API dokumentaciju, istraživanja, stranice za medije ili pravila. Oduprite se porivu da navedete sve. Što datoteka postane sveobuhvatnija, to je manje korisna kao polazište.

Što ne stavljati u llms.txt

Ne stavljajte privatne informacije u njega. To zvuči očito, ali tekstne datoteke na razini korijena često postanu odlagalište operativnih bilješki.

Izbjegavajte uključivati:

  • neobjavljene URL-ove;
  • interne staging poveznice;
  • API ključeve ili tokene;
  • privatne podatke za kontakt;
  • sigurnosne upute;
  • informacije o proizvodima pod embargom;
  • „tajne” stranice za koje se nadate da će ih crawleri ignorirati.

Ako nešto ne bi smjelo biti javno, nemojte to spominjati u javnoj datoteci.

Također izbjegavajte nejasan pravni teatar. „Svaka AI upotreba zauvijek je zabranjena” možda izražava frustraciju, ali ne stvara pouzdanu tehničku kontrolu. Ako vašoj organizaciji doista trebaju provediva ograničenja, uključite pravni savjet i zajedno upotrijebite kontrole crawlera, licencne uvjete i kontrole pristupa.

Kako se llms.txt odnosi prema robots.txt

Upotrijebite robots.txt za direktive o crawlanju. Upotrijebite llms.txt za kontekst.

Pojednostavljena podjela:

| Datoteka | Glavna svrha | Provedivo? | Najbolje za | |---|---|---:|---| | robots.txt | Dopuštenja za crawling | Dobrovoljno, ali široko prepoznato | Dopuštanje ili zabrana crawlera prema putanji i user agentu | | llms.txt | Sažetak i smjernice za LLM-ove | Trenutačno nije standardizirano | Kanonske poveznice, politika sadržaja, napomene za tumačenje | | Stranica s uvjetima | Pravni uvjeti | Ovisi o nadležnosti i činjenicama | Licenciranje, dopuštena ponovna upotreba, komercijalna ograničenja | | HTTP zaglavlja | Tehnički signali na razini stranice | Ovisi o podršci crawlera | Indeksiranje, predmemoriranje i ponašanje odgovora |

Ako već otklanjate pogreške u ponašanju crawlera, nemojte stati na tekstnoj datoteci. Provjerite poslužuje li vaše web-mjesto datoteku doista ispravno, ponašaju li se preusmjeravanja očekivano i odgovaraju li zaglavlja vašoj politici. Napisali smo zaseban vodič za otklanjanje pogrešaka u preusmjeravanjima i HTTP zaglavljima u produkciji jer tu mnoge odluke o „politici” tiho zakažu.

Praktičan proces pisanja

Evo razumnog tijeka rada.

1. Odredite posao datoteke

Odaberite jedan primarni cilj:

  • pomoći AI sustavima da točno opišu vaše web-mjesto;
  • usmjeriti agente prema aktualnoj dokumentaciji;
  • navesti preferencije ponovne upotrebe i atribucije;
  • smanjiti zabunu oko arhiviranog ili korisnički generiranog sadržaja.

Ako pokušate natjerati llms.txt da riješi svaki problem upravljanja AI-jem, neće riješiti nijedan.

2. Identificirajte kanonske stranice

Odaberite 5–20 URL-ova koji najbolje predstavljaju web-mjesto. Dajte prednost stabilnim, održavanim stranicama pred stranicama s velikim prometom. Za SaaS tvrtku to mogu biti početna stranica, dokumentacija, cijene, sigurnost, privatnost, API referenca, status i kontakt. Za izdavača to mogu biti tematska središta, urednički standardi, autorske stranice, politika ispravaka i licenciranje.

3. Pišite za strojeve i ljude

Upotrijebite jasne Markdown naslove. Izbjegavajte marketinški tekst. Recite što je web-mjesto u jednoj ili dvije rečenice.

Loše:

We are revolutionizing the future of digital excellence with next-generation solutions.

Bolje:

Acme Docs publishes technical documentation for Acme’s payments API, including authentication, webhooks, SDKs, and migration guides.

4. Pažljivo dodajte jezik politike

Odjeljak o politici trebao bi biti razumljiv bez pretjeranog samopouzdanja. Na primjer:

Public pages may be summarized for search, accessibility, and user assistance with attribution. Bulk copying, dataset creation, or model training requires permission.

To ne jamči usklađenost, ali je jasnije od šutnje.

5. Objavite ga i održavajte

Postavite ga na /llms.txt. Poslužujte ga kao text/plain ili kompatibilan tekstni odgovor. Povezujte samo na kanonske URL-ove. Pregledajte ga kada se promijeni vaša informacijska arhitektura.

Zastarjeli llms.txt gori je od nikakve datoteke jer daje sigurne upute koje više nisu točne.

Treba li ga imati svako web-mjesto?

Ne.

Web-mjestu od pet stranica u obliku brošure vjerojatno ne treba llms.txt. Lokalnom restoranu ne treba, osim ako ima strukturirana pravila ili informacije o rezervacijama koje AI pomoćnici često pogrešno navode.

Postaje korisniji kada:

  • vaše web-mjesto ima mnogo dokumentacije;
  • stari sadržaj konkurira novom sadržaju;
  • objavljujete istraživački ili urednički materijal;
  • licenciranje i atribucija su važni;
  • AI pomoćnici često sažimaju vaše stranice;
  • interni timovi trebaju zajedničku politiku za javni sadržaj.

Koristan je i kao dio interne vježbe upravljanja. Mnoge tvrtke već imaju zaposlenike koji lijepe web-stranice, dokumente i materijale kupaca u AI sustave. Ako vam to zvuči poznato, provedite osnovnu reviziju shadow AI-ja prije nego što pretpostavite da će javna tekstna datoteka riješiti rizik.

SEO implikacije

llms.txt nije faktor rangiranja ni u jednom ustaljenom smislu. Nemojte ga pisati zato što očekujete rast prometa sljedeći tjedan.

Neizravni SEO argument skromniji je:

  • prisiljava na kanonsko razmišljanje;
  • može pomoći pretraživanju posredovanom AI-jem i sustavima za odgovore da razumiju vaše web-mjesto;
  • razjašnjava preferencije atribucije;
  • smanjuje dvosmislenost oko arhiviranih stranica;
  • stvara javnu, provjerljivu politiku upotrebe AI sadržaja.

To je vrijedno za neka web-mjesta. Nije čarobni sloj optimizacije.

Najbolja verzija llms.txt mala je, aktualna i usklađena s ostatkom vašeg web-mjesta. Ako vaša robots pravila, stranica s uvjetima, sitemap, kanonske oznake i llms.txt govore različite stvari, problem nije AI crawling. Problem je upravljanje.

<!-- tool-cta:start -->

💡 Isprobajte ovo: Budući da llms.txt nije provediv, uparite ga s provedivim pravilima i provjerite ih u Robots.txt Tester kako bi se crawleri koji poštuju standarde ponašali ispravno.

<!-- tool-cta:end -->

Završna preporuka

Ako vaše web-mjesto ima dokumentaciju, urednički sadržaj ili brige oko licenciranja, izradite jednostavan llms.txt. Držite ga ispod nekoliko desetaka redaka. Upotrijebite ga za upućivanje na kanonske resurse i navođenje preferencija ponovne upotrebe.

Ali nemojte brkati komunikaciju s kontrolom.

Za blokiranje upotrijebite mehanizme za crawlere koji su vam dostupni i razumijte njihova ograničenja. Za politiku objavite jasne uvjete. Za povjerenje budite transparentni prema čitateljima. llms.txt pripada tom skupu kao koristan signal — ne kao štit.

Često postavljana pitanja

Je li llms.txt službeni standard?
Ne. To je novi prijedlog i konvencija, a ne formalni web-standard poput protokola robots.txt opisanog u RFC 9309.
Hoće li llms.txt spriječiti AI tvrtke da treniraju na mom sadržaju?
Ne pouzdano. Možete navesti svoju preferenciju, ali usklađenost ovisi o crawleru ili AI tvrtki. Upotrijebite robots.txt, kontrole pristupa, licencne uvjete i pravno savjetovanje ondje gdje su potrebne jače kontrole.
Gdje trebam staviti llms.txt?
Postavite ga u korijen svoje domene, primjerice https://example.com/llms.txt, i pobrinite se da bude javno dostupan kao obična tekstna datoteka ili datoteka u Markdown stilu.
Treba li llms.txt uključivati svaku stranicu na mom web-mjestu?
Ne. Trebao bi upućivati na najautoritativnije i najstabilnije resurse. Kratka, kurirana datoteka korisnija je od dugačkog dupliciranog sitemapa.
Pomaže li llms.txt SEO-u?
Ne postoji utvrđena korist za rangiranje. Njegova je vrijednost neizravna: jasnije kanonske stranice, bolji kontekst za AI sustave i javna politika upotrebe sadržaja.

Izvori i daljnje čitanje

  1. llms.txt proposal
  2. RFC 9309: Robots Exclusion Protocol
  3. Google Search Central: robots.txt introduction and guide
  4. OpenAI: Web crawlers and user agents
O autoru
The Wux Webtools Team

Zadnje ažurirano:

Nastavite čitati