Hogyan írjunk llms.txt-t — és hogy csinál-e egyáltalán bármit
Gyakorlati útmutató a kialakulóban lévő fájlhoz AI-bejárók, tartalmi összefoglalók és modelleknek szóló webhelyutasítások számára.
Tartalomjegyzék
- Röviden
- Milyen problémát hivatott megoldani az llms.txt?
- Csinál-e ténylegesen bármit az llms.txt?
- Nem blokkolja megbízhatóan az AI-bejárókat
- Segíthet az értelmezésben
- Tisztázhatja a tartalmi szabályzatot
- Mit tegyünk az llms.txt-be?
- Mit ne tegyünk az llms.txt-be?
- Hogyan kapcsolódik az llms.txt a robots.txt-hez?
- Gyakorlati írási folyamat
- 1. Döntsük el, mi a fájl feladata
- 2. Azonosítsuk a kanonikus oldalakat
- 3. Írjunk gépeknek és embereknek
- 4. Óvatosan adjunk hozzá szabályzati nyelvezetet
- 5. Tegyük közzé és tartsuk karban
- Minden webhelynek szüksége van rá?
- SEO-vonatkozások
- Záró ajánlás
Röviden
Az llms.txt egy kialakulóban lévő konvenció arra, hogy elmondjuk a nagy nyelvi modelleknek, mi a webhelyünk, mely oldalak fontosak, és hogyan érdemes értelmezni a tartalmainkat. Általában a https://example.com/llms.txt címen található, Markdownban íródik, és tiszta, hasznos erőforrásokra hivatkozik.
Nem ugyanaz, mint a robots.txt. Nem hivatalos webes szabvány. Nem blokkolja megbízhatóan az AI-tanítást. Nem kényszerít egy AI-vállalatot arra, hogy kövesse a kívánságainkat.
Ennek ellenére érdemes lehet megírni.
Egy jó llms.txt alacsony költségű módja annak, hogy a webhelyünket az AI-rendszerek, ügynökök, keresési asszisztensek és belső eszközök könnyebben és pontosabban foglalják össze. Egyben kényszerítő gyakorlat is: el kell döntenünk, mely tartalmak kanonikusak, melyek elavultak, és milyen feltételek vonatkoznak az újrafelhasználásra. Ez akkor is hasznos, ha jelenleg csak kevés rendszer olvassa a fájlt.
Milyen problémát hivatott megoldani az llms.txt?
A legtöbb webhely embereknek és keresőrobotoknak készül. Tartalmaz navigációt, cookie-bannereket, termékkártyákat, duplikált kategóriaoldalakat, régi PDF-eket, követési paramétereket, valamint olyan tartalmat, amely csak vizuálisan nyeri el az értelmét.
Az LLM-eknek nincs szükségük ugyanarra a megjelenítési rétegre. Amire szükségük van:
- a webhely tömör leírása;
- hivatkozások a leginkább mérvadó oldalakra;
- közérthető kontextus termékekről, dokumentációról, szabályzatokról vagy szerzőségről;
- licencelési és felhasználási preferenciák;
- hivatkozások strukturált vagy Markdown-verziókra, ahol elérhetők.
Az llms.txt javaslat egy ismerős webes ötletet vesz át: tegyünk egy kiszámítható szövegfájlt a domain gyökerébe. A robots.txt-vel ellentétben, amely elsősorban bejárási engedélyekről szól, az llms.txt főként tájékozódást segít.
Tekintsünk rá térképként, ne kapuként.
Csinál-e ténylegesen bármit az llms.txt?
Ma az őszinte válasz ez: néha igen, de nem úgy, ahogyan sokan remélik.
Nem blokkolja megbízhatóan az AI-bejárókat
Ha a célunk a bejárás vagy a tanítás megakadályozása, az llms.txt nem megfelelő elsődleges mechanizmus. Azok a bejárók, amelyek tiszteletben tartják a kizárási szabályokat, nagyobb valószínűséggel nézik a robots.txt-t, a konkrét user-agent direktívákat, a HTTP-fejléceket vagy a szerződéses/licencelési jelzéseket. A megfelelés még ekkor is a bejárót üzemeltető fél döntésén múlik.
A webnek hosszú története van ezen a téren. Maga a robots.txt is önkéntes protokoll, amelyet később az RFC 9309 formalizált. Azért működik, mert a nagy bejárók úgy döntenek, hogy betartják — nem azért, mert a fájlnak mágikus kikényszerítő ereje van.
Az llms.txt elfogadottsága és szabványosítottsága kisebb, mint a robots.txt-é. Gyanakvással kezeljünk minden olyan állítást, hogy „megvédi a tartalmunkat az AI-tól”.
Segíthet az értelmezésben
Ahol az llms.txt ígéretesebb, az a tartalom értelmezése.
Ha egy AI-asszisztens kérdésekre próbál válaszolni a vállalatunkról, dokumentációnkról, kutatásunkról, árazásunkról, API-nkról vagy szerkesztőségi szabályzatunkról, egy tömör, gyökérszintű fájl csökkentheti a találgatást. A rendszert azokhoz az oldalakhoz irányíthatja, amelyeket ténylegesen karbantartunk, és eltávolíthatja az elavult töredékektől.
Ez különösen fontos nagy archívummal rendelkező webhelyeknél. Egy modell vagy ügynök könnyen megtalálhat egy 2019-es támogatási cikket egy 2026-os szabályzatoldal előtt. Az llms.txt lényegében ezt mondhatja: „Itt kezdj. Ezek a mérvadó erőforrások.”
Ez nem látványos, de hasznos.
Tisztázhatja a tartalmi szabályzatot
Egy nyilvános, AI-nak szánt szabályzat jobb, mint a hallgatás — különösen kiadók, dokumentációs csapatok és érzékeny márka-, orvosi, jogi vagy pénzügyi anyagokkal dolgozó vállalatok esetében.
Ez nem azt jelenti, hogy fenyegető jogi szövegfalat kell írnunk. Azt jelenti, hogy világosan megfogalmazhatjuk:
- összefoglalhatják-e az AI-rendszerek a nyilvános oldalainkat;
- felhasználható-e a tartalmunk modellek tanítására;
- hogyan szeretnénk kezelni a forrásmegjelölést;
- mely oldalakat kell kanonikusnak tekinteni;
- kihez lehet fordulni licencelés vagy adatpartnerség ügyében.
Ez jól illeszkedik a tágabb szerkesztőségi átláthatósághoz. Ha AI-val támogatott tartalmat teszünk közzé, az llms.txt nem mondhat ellent a nyilvános tájékoztatásunknak. Gyakorlati alapként lásd útmutatónkat az őszinte AI-tájékoztatásról egy kis webhelyen.
Mit tegyünk az llms.txt-be?
Nincs általánosan kikényszerített séma, de a jelenlegi konvenció a Markdown. Legyen rövid, egyértelmű és unalmas.
Egy hasznos szerkezet így néz ki:
# Example Company
> Example Company publishes practical guides and reference material for independent web developers.
## Canonical resources
- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/
## Content use policy
Public pages may be summarized with attribution to Example Company and a link to the source page.
Use of our content for model training, dataset creation, or bulk republication requires written permission.
## Preferred citation
When citing our content, link to the canonical URL and include the page title.
## Notes for AI systems
- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.
Sok webhely számára ennyi elég.
Nagyobb webhelyeknél hozzáadhatunk szakaszokat termékterületekhez, API-dokumentációhoz, kutatáshoz, sajtóoldalakhoz vagy jogi szabályzatokhoz. Álljunk ellen a kísértésnek, hogy mindent felsoroljunk. Minél átfogóbbá válik a fájl, annál kevésbé hasznos kiindulópontként.
Mit ne tegyünk az llms.txt-be?
Ne tegyünk bele privát információt. Ez nyilvánvalónak hangzik, de a gyökérszintű szövegfájlok gyakran válnak operatív jegyzetek lerakóhelyévé.
Kerüljük az alábbiak beillesztését:
- nem publikált URL-ek;
- belső staging hivatkozások;
- API-kulcsok vagy tokenek;
- privát elérhetőségek;
- biztonsági utasítások;
- embargó alatt álló termékinformációk;
- „titkos” oldalak, amelyekről azt reméljük, hogy a bejárók figyelmen kívül hagyják.
Ha valaminek nem szabad nyilvánosnak lennie, ne említsük meg egy nyilvános fájlban.
Kerüljük a homályos jogi színjátékot is. Az „Minden AI-felhasználás örökre tilos” kifejezheti a frusztrációt, de nem hoz létre megbízható technikai kontrollt. Ha a szervezetünknek valóban kikényszeríthető korlátozásokra van szüksége, vonjunk be jogi tanácsadót, és használjunk együtt bejáróvezérlést, licencfeltételeket és hozzáférés-szabályozást.
Hogyan kapcsolódik az llms.txt a robots.txt-hez?
A robots.txt-t használjuk bejárási direktívákhoz. Az llms.txt-t kontextushoz.
Egyszerűsített felosztás:
| Fájl | Fő cél | Kikényszeríthető? | Mire a legjobb | |---|---|---:|---| | robots.txt | Bejárási engedélyek | Önkéntes, de széles körben elismert | Bejárók engedélyezése vagy tiltása útvonal és user agent szerint | | llms.txt | LLM-eknek szóló összefoglaló és útmutatás | Jelenleg nem szabványosított | Kanonikus hivatkozások, tartalmi szabályzat, értelmezési megjegyzések | | Feltételek oldala | Jogi feltételek | Joghatóságtól és tényállástól függ | Licencelés, engedélyezett újrafelhasználás, kereskedelmi korlátozások | | HTTP-fejlécek | Oldalszintű technikai jelzések | A bejáró támogatásától függ | Indexelés, gyorsítótárazás és válaszviselkedés |
Ha már bejáróviselkedést hibakeresünk, ne álljunk meg a szövegfájlnál. Ellenőrizzük, hogy a webhely valóban helyesen szolgálja-e ki a fájlt, az átirányítások a vártak szerint működnek-e, és a fejlécek összhangban vannak-e a szabályzatunkkal. Külön útmutatót írtunk az átirányítások és HTTP-fejlécek éles környezetbeli hibakereséséről, mert sok „szabályzati” döntés csendben éppen itt bukik el.
Gyakorlati írási folyamat
Íme egy ésszerű munkamenet.
1. Döntsük el, mi a fájl feladata
Válasszunk egy elsődleges célt:
- segítsen az AI-rendszereknek pontosan leírni a webhelyünket;
- az ügynököket az aktuális dokumentáció felé irányítsa;
- megfogalmazza az újrafelhasználási és forrásmegjelölési preferenciákat;
- csökkentse a félreértést az archivált vagy felhasználók által létrehozott tartalom körül.
Ha az llms.txt-vel minden AI-governance problémát meg akarunk oldani, végül egyiket sem fogja megoldani.
2. Azonosítsuk a kanonikus oldalakat
Válasszuk ki azt az 5–20 URL-t, amely a legjobban képviseli a webhelyet. Részesítsük előnyben a stabil, karbantartott oldalakat a nagy forgalmú oldalakkal szemben. Egy SaaS-vállalatnál ez lehet a főoldal, a dokumentáció, az árazás, a biztonság, az adatvédelem, az API-referencia, a státuszoldal és a kapcsolat. Egy kiadónál lehetnek témaközpontok, szerkesztőségi normák, szerzői oldalak, helyesbítési szabályzat és licencelés.
3. Írjunk gépeknek és embereknek
Használjunk egyszerű Markdown címsorokat. Kerüljük a marketingnyelvet. Egy-két mondatban mondjuk el, mi a webhely.
Rossz:
Forradalmasítjuk a digitális kiválóság jövőjét következő generációs megoldásokkal.
Jobb:
Acme Docs technical documentation for Acme’s payments API, including authentication, webhooks, SDKs, and migration guides.
4. Óvatosan adjunk hozzá szabályzati nyelvezetet
A szabályzati szakasznak érthetőnek kell lennie anélkül, hogy túl magabiztos lenne. Például:
A nyilvános oldalak összefoglalhatók kereséshez, akadálymentesítéshez és felhasználói segítséghez, forrásmegjelöléssel. A tömeges másolás, adatkészlet-készítés vagy modelltanítás engedélyhez kötött.
Ez nem garantálja a megfelelést, de világosabb, mint a csend.
5. Tegyük közzé és tartsuk karban
Helyezzük el a /llms.txt címen. Szolgáljuk ki text/plain típusként vagy kompatibilis szöveges válaszként. Csak kanonikus URL-ekre hivatkozzunk. Tekintsük át, amikor az információs architektúránk megváltozik.
Egy elavult llms.txt rosszabb, mint ha nincs fájl, mert magabiztos utasításokat ad, amelyek már nem igazak.
Minden webhelynek szüksége van rá?
Nem.
Egy ötoldalas bemutatkozó webhelynek valószínűleg nincs szüksége llms.txt-re. Egy helyi étteremnek sincs, hacsak nincs olyan strukturált szabályzata vagy foglalási információja, amelyet az AI-asszisztensek gyakran pontatlanul adnak vissza.
Hasznosabbá válik, ha:
- a webhely sok dokumentációt tartalmaz;
- a régi tartalom versenyez az új tartalommal;
- kutatási vagy szerkesztőségi anyagokat publikálunk;
- fontos a licencelés és a forrásmegjelölés;
- az AI-asszisztensek gyakran összefoglalják az oldalainkat;
- a belső csapatoknak közös szabályzatra van szükségük a nyilvános tartalomhoz.
Belső governance gyakorlat részeként is hasznos. Sok vállalatnál a munkatársak már most weboldalakat, dokumentumokat és ügyfélanyagokat illesztenek be AI-rendszerekbe. Ha ez ismerősen hangzik, végezzünk el egy alapvető árnyék-AI auditot, mielőtt azt feltételeznénk, hogy egy nyilvános szövegfájl megoldja a kockázatot.
SEO-vonatkozások
Az llms.txt semmilyen bevett értelemben nem rangsorolási tényező. Ne azért írjunk ilyet, mert a jövő héten forgalomnövekedést várunk tőle.
Az indirekt SEO-érv szerényebb:
- kanonikus gondolkodásra kényszerít;
- segíthet az AI-közvetített keresési és válaszadó rendszereknek megérteni a webhelyünket;
- tisztázza a forrásmegjelölési preferenciákat;
- csökkenti az archivált oldalak körüli kétértelműséget;
- nyilvános, ellenőrizhető AI-tartalomfelhasználási szabályzatot hoz létre.
Ez egyes webhelyeknek értékes. Nem mágikus optimalizálási réteg.
Az llms.txt legjobb változata kicsi, aktuális, és összhangban van a webhely többi részével. Ha a robots szabályok, a feltételek oldala, a sitemap, a kanonikus tagek és az llms.txt mind mást mondanak, akkor a probléma nem az AI-bejárás. A probléma a governance.
<!-- tool-cta:start -->
💡 Próbálja ki ezt: Mivel az llms.txt nem kényszeríthető ki, párosítsa kikényszeríthető szabályokkal, és ellenőrizze őket a Robots.txt Tester eszközben, hogy a szabványokat betartó crawlerek megfelelően viselkedjenek.
<!-- tool-cta:end -->
Záró ajánlás
Ha a webhelyünkön dokumentáció, szerkesztőségi tartalom vagy licencelési kérdés található, hozzunk létre egy egyszerű llms.txt-t. Tartsuk néhány tucat sor alatt. Használjuk arra, hogy kanonikus erőforrásokra mutasson, és megfogalmazza az újrafelhasználási preferenciáinkat.
De ne keverjük össze a kommunikációt az irányítással.
Blokkoláshoz használjuk a rendelkezésünkre álló bejárómechanizmusokat, és értsük meg a korlátaikat. Szabályzathoz tegyünk közzé világos feltételeket. Bizalomhoz legyünk átláthatók az olvasókkal. Az llms.txt ebbe a rendszerbe tartozik hasznos jelzésként — nem pajzsként.