SEO & Discoverability

Hogyan írjunk llms.txt-t — és hogy csinál-e egyáltalán bármit

Gyakorlati útmutató a kialakulóban lévő fájlhoz AI-bejárók, tartalmi összefoglalók és modelleknek szóló webhelyutasítások számára.

The Wux Webtools Team The Wux Webtools Team 12 min olvasás AI-támogatott, ember által ellenőrzött
Abstract illustration of an llms.txt file guiding AI crawler paths through a website structure.
Tartalomjegyzék
  1. Röviden
  2. Milyen problémát hivatott megoldani az llms.txt?
  3. Csinál-e ténylegesen bármit az llms.txt?
  4. Nem blokkolja megbízhatóan az AI-bejárókat
  5. Segíthet az értelmezésben
  6. Tisztázhatja a tartalmi szabályzatot
  7. Mit tegyünk az llms.txt-be?
  8. Mit ne tegyünk az llms.txt-be?
  9. Hogyan kapcsolódik az llms.txt a robots.txt-hez?
  10. Gyakorlati írási folyamat
  11. 1. Döntsük el, mi a fájl feladata
  12. 2. Azonosítsuk a kanonikus oldalakat
  13. 3. Írjunk gépeknek és embereknek
  14. 4. Óvatosan adjunk hozzá szabályzati nyelvezetet
  15. 5. Tegyük közzé és tartsuk karban
  16. Minden webhelynek szüksége van rá?
  17. SEO-vonatkozások
  18. Záró ajánlás

Röviden

Az llms.txt egy kialakulóban lévő konvenció arra, hogy elmondjuk a nagy nyelvi modelleknek, mi a webhelyünk, mely oldalak fontosak, és hogyan érdemes értelmezni a tartalmainkat. Általában a https://example.com/llms.txt címen található, Markdownban íródik, és tiszta, hasznos erőforrásokra hivatkozik.

Nem ugyanaz, mint a robots.txt. Nem hivatalos webes szabvány. Nem blokkolja megbízhatóan az AI-tanítást. Nem kényszerít egy AI-vállalatot arra, hogy kövesse a kívánságainkat.

Ennek ellenére érdemes lehet megírni.

Egy jó llms.txt alacsony költségű módja annak, hogy a webhelyünket az AI-rendszerek, ügynökök, keresési asszisztensek és belső eszközök könnyebben és pontosabban foglalják össze. Egyben kényszerítő gyakorlat is: el kell döntenünk, mely tartalmak kanonikusak, melyek elavultak, és milyen feltételek vonatkoznak az újrafelhasználásra. Ez akkor is hasznos, ha jelenleg csak kevés rendszer olvassa a fájlt.

Milyen problémát hivatott megoldani az llms.txt?

A legtöbb webhely embereknek és keresőrobotoknak készül. Tartalmaz navigációt, cookie-bannereket, termékkártyákat, duplikált kategóriaoldalakat, régi PDF-eket, követési paramétereket, valamint olyan tartalmat, amely csak vizuálisan nyeri el az értelmét.

Az LLM-eknek nincs szükségük ugyanarra a megjelenítési rétegre. Amire szükségük van:

  • a webhely tömör leírása;
  • hivatkozások a leginkább mérvadó oldalakra;
  • közérthető kontextus termékekről, dokumentációról, szabályzatokról vagy szerzőségről;
  • licencelési és felhasználási preferenciák;
  • hivatkozások strukturált vagy Markdown-verziókra, ahol elérhetők.

Az llms.txt javaslat egy ismerős webes ötletet vesz át: tegyünk egy kiszámítható szövegfájlt a domain gyökerébe. A robots.txt-vel ellentétben, amely elsősorban bejárási engedélyekről szól, az llms.txt főként tájékozódást segít.

Tekintsünk rá térképként, ne kapuként.

Csinál-e ténylegesen bármit az llms.txt?

Ma az őszinte válasz ez: néha igen, de nem úgy, ahogyan sokan remélik.

Nem blokkolja megbízhatóan az AI-bejárókat

Ha a célunk a bejárás vagy a tanítás megakadályozása, az llms.txt nem megfelelő elsődleges mechanizmus. Azok a bejárók, amelyek tiszteletben tartják a kizárási szabályokat, nagyobb valószínűséggel nézik a robots.txt-t, a konkrét user-agent direktívákat, a HTTP-fejléceket vagy a szerződéses/licencelési jelzéseket. A megfelelés még ekkor is a bejárót üzemeltető fél döntésén múlik.

A webnek hosszú története van ezen a téren. Maga a robots.txt is önkéntes protokoll, amelyet később az RFC 9309 formalizált. Azért működik, mert a nagy bejárók úgy döntenek, hogy betartják — nem azért, mert a fájlnak mágikus kikényszerítő ereje van.

Az llms.txt elfogadottsága és szabványosítottsága kisebb, mint a robots.txt-é. Gyanakvással kezeljünk minden olyan állítást, hogy „megvédi a tartalmunkat az AI-tól”.

Segíthet az értelmezésben

Ahol az llms.txt ígéretesebb, az a tartalom értelmezése.

Ha egy AI-asszisztens kérdésekre próbál válaszolni a vállalatunkról, dokumentációnkról, kutatásunkról, árazásunkról, API-nkról vagy szerkesztőségi szabályzatunkról, egy tömör, gyökérszintű fájl csökkentheti a találgatást. A rendszert azokhoz az oldalakhoz irányíthatja, amelyeket ténylegesen karbantartunk, és eltávolíthatja az elavult töredékektől.

Ez különösen fontos nagy archívummal rendelkező webhelyeknél. Egy modell vagy ügynök könnyen megtalálhat egy 2019-es támogatási cikket egy 2026-os szabályzatoldal előtt. Az llms.txt lényegében ezt mondhatja: „Itt kezdj. Ezek a mérvadó erőforrások.”

Ez nem látványos, de hasznos.

Tisztázhatja a tartalmi szabályzatot

Egy nyilvános, AI-nak szánt szabályzat jobb, mint a hallgatás — különösen kiadók, dokumentációs csapatok és érzékeny márka-, orvosi, jogi vagy pénzügyi anyagokkal dolgozó vállalatok esetében.

Ez nem azt jelenti, hogy fenyegető jogi szövegfalat kell írnunk. Azt jelenti, hogy világosan megfogalmazhatjuk:

  • összefoglalhatják-e az AI-rendszerek a nyilvános oldalainkat;
  • felhasználható-e a tartalmunk modellek tanítására;
  • hogyan szeretnénk kezelni a forrásmegjelölést;
  • mely oldalakat kell kanonikusnak tekinteni;
  • kihez lehet fordulni licencelés vagy adatpartnerség ügyében.

Ez jól illeszkedik a tágabb szerkesztőségi átláthatósághoz. Ha AI-val támogatott tartalmat teszünk közzé, az llms.txt nem mondhat ellent a nyilvános tájékoztatásunknak. Gyakorlati alapként lásd útmutatónkat az őszinte AI-tájékoztatásról egy kis webhelyen.

Mit tegyünk az llms.txt-be?

Nincs általánosan kikényszerített séma, de a jelenlegi konvenció a Markdown. Legyen rövid, egyértelmű és unalmas.

Egy hasznos szerkezet így néz ki:

# Example Company

> Example Company publishes practical guides and reference material for independent web developers.

## Canonical resources

- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/

## Content use policy

Public pages may be summarized with attribution to Example Company and a link to the source page.

Use of our content for model training, dataset creation, or bulk republication requires written permission.

## Preferred citation

When citing our content, link to the canonical URL and include the page title.

## Notes for AI systems

- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.

Sok webhely számára ennyi elég.

Nagyobb webhelyeknél hozzáadhatunk szakaszokat termékterületekhez, API-dokumentációhoz, kutatáshoz, sajtóoldalakhoz vagy jogi szabályzatokhoz. Álljunk ellen a kísértésnek, hogy mindent felsoroljunk. Minél átfogóbbá válik a fájl, annál kevésbé hasznos kiindulópontként.

Mit ne tegyünk az llms.txt-be?

Ne tegyünk bele privát információt. Ez nyilvánvalónak hangzik, de a gyökérszintű szövegfájlok gyakran válnak operatív jegyzetek lerakóhelyévé.

Kerüljük az alábbiak beillesztését:

  • nem publikált URL-ek;
  • belső staging hivatkozások;
  • API-kulcsok vagy tokenek;
  • privát elérhetőségek;
  • biztonsági utasítások;
  • embargó alatt álló termékinformációk;
  • „titkos” oldalak, amelyekről azt reméljük, hogy a bejárók figyelmen kívül hagyják.

Ha valaminek nem szabad nyilvánosnak lennie, ne említsük meg egy nyilvános fájlban.

Kerüljük a homályos jogi színjátékot is. Az „Minden AI-felhasználás örökre tilos” kifejezheti a frusztrációt, de nem hoz létre megbízható technikai kontrollt. Ha a szervezetünknek valóban kikényszeríthető korlátozásokra van szüksége, vonjunk be jogi tanácsadót, és használjunk együtt bejáróvezérlést, licencfeltételeket és hozzáférés-szabályozást.

Hogyan kapcsolódik az llms.txt a robots.txt-hez?

A robots.txt-t használjuk bejárási direktívákhoz. Az llms.txt-t kontextushoz.

Egyszerűsített felosztás:

| Fájl | Fő cél | Kikényszeríthető? | Mire a legjobb | |---|---|---:|---| | robots.txt | Bejárási engedélyek | Önkéntes, de széles körben elismert | Bejárók engedélyezése vagy tiltása útvonal és user agent szerint | | llms.txt | LLM-eknek szóló összefoglaló és útmutatás | Jelenleg nem szabványosított | Kanonikus hivatkozások, tartalmi szabályzat, értelmezési megjegyzések | | Feltételek oldala | Jogi feltételek | Joghatóságtól és tényállástól függ | Licencelés, engedélyezett újrafelhasználás, kereskedelmi korlátozások | | HTTP-fejlécek | Oldalszintű technikai jelzések | A bejáró támogatásától függ | Indexelés, gyorsítótárazás és válaszviselkedés |

Ha már bejáróviselkedést hibakeresünk, ne álljunk meg a szövegfájlnál. Ellenőrizzük, hogy a webhely valóban helyesen szolgálja-e ki a fájlt, az átirányítások a vártak szerint működnek-e, és a fejlécek összhangban vannak-e a szabályzatunkkal. Külön útmutatót írtunk az átirányítások és HTTP-fejlécek éles környezetbeli hibakereséséről, mert sok „szabályzati” döntés csendben éppen itt bukik el.

Gyakorlati írási folyamat

Íme egy ésszerű munkamenet.

1. Döntsük el, mi a fájl feladata

Válasszunk egy elsődleges célt:

  • segítsen az AI-rendszereknek pontosan leírni a webhelyünket;
  • az ügynököket az aktuális dokumentáció felé irányítsa;
  • megfogalmazza az újrafelhasználási és forrásmegjelölési preferenciákat;
  • csökkentse a félreértést az archivált vagy felhasználók által létrehozott tartalom körül.

Ha az llms.txt-vel minden AI-governance problémát meg akarunk oldani, végül egyiket sem fogja megoldani.

2. Azonosítsuk a kanonikus oldalakat

Válasszuk ki azt az 5–20 URL-t, amely a legjobban képviseli a webhelyet. Részesítsük előnyben a stabil, karbantartott oldalakat a nagy forgalmú oldalakkal szemben. Egy SaaS-vállalatnál ez lehet a főoldal, a dokumentáció, az árazás, a biztonság, az adatvédelem, az API-referencia, a státuszoldal és a kapcsolat. Egy kiadónál lehetnek témaközpontok, szerkesztőségi normák, szerzői oldalak, helyesbítési szabályzat és licencelés.

3. Írjunk gépeknek és embereknek

Használjunk egyszerű Markdown címsorokat. Kerüljük a marketingnyelvet. Egy-két mondatban mondjuk el, mi a webhely.

Rossz:

Forradalmasítjuk a digitális kiválóság jövőjét következő generációs megoldásokkal.

Jobb:

Acme Docs technical documentation for Acme’s payments API, including authentication, webhooks, SDKs, and migration guides.

4. Óvatosan adjunk hozzá szabályzati nyelvezetet

A szabályzati szakasznak érthetőnek kell lennie anélkül, hogy túl magabiztos lenne. Például:

A nyilvános oldalak összefoglalhatók kereséshez, akadálymentesítéshez és felhasználói segítséghez, forrásmegjelöléssel. A tömeges másolás, adatkészlet-készítés vagy modelltanítás engedélyhez kötött.

Ez nem garantálja a megfelelést, de világosabb, mint a csend.

5. Tegyük közzé és tartsuk karban

Helyezzük el a /llms.txt címen. Szolgáljuk ki text/plain típusként vagy kompatibilis szöveges válaszként. Csak kanonikus URL-ekre hivatkozzunk. Tekintsük át, amikor az információs architektúránk megváltozik.

Egy elavult llms.txt rosszabb, mint ha nincs fájl, mert magabiztos utasításokat ad, amelyek már nem igazak.

Minden webhelynek szüksége van rá?

Nem.

Egy ötoldalas bemutatkozó webhelynek valószínűleg nincs szüksége llms.txt-re. Egy helyi étteremnek sincs, hacsak nincs olyan strukturált szabályzata vagy foglalási információja, amelyet az AI-asszisztensek gyakran pontatlanul adnak vissza.

Hasznosabbá válik, ha:

  • a webhely sok dokumentációt tartalmaz;
  • a régi tartalom versenyez az új tartalommal;
  • kutatási vagy szerkesztőségi anyagokat publikálunk;
  • fontos a licencelés és a forrásmegjelölés;
  • az AI-asszisztensek gyakran összefoglalják az oldalainkat;
  • a belső csapatoknak közös szabályzatra van szükségük a nyilvános tartalomhoz.

Belső governance gyakorlat részeként is hasznos. Sok vállalatnál a munkatársak már most weboldalakat, dokumentumokat és ügyfélanyagokat illesztenek be AI-rendszerekbe. Ha ez ismerősen hangzik, végezzünk el egy alapvető árnyék-AI auditot, mielőtt azt feltételeznénk, hogy egy nyilvános szövegfájl megoldja a kockázatot.

SEO-vonatkozások

Az llms.txt semmilyen bevett értelemben nem rangsorolási tényező. Ne azért írjunk ilyet, mert a jövő héten forgalomnövekedést várunk tőle.

Az indirekt SEO-érv szerényebb:

  • kanonikus gondolkodásra kényszerít;
  • segíthet az AI-közvetített keresési és válaszadó rendszereknek megérteni a webhelyünket;
  • tisztázza a forrásmegjelölési preferenciákat;
  • csökkenti az archivált oldalak körüli kétértelműséget;
  • nyilvános, ellenőrizhető AI-tartalomfelhasználási szabályzatot hoz létre.

Ez egyes webhelyeknek értékes. Nem mágikus optimalizálási réteg.

Az llms.txt legjobb változata kicsi, aktuális, és összhangban van a webhely többi részével. Ha a robots szabályok, a feltételek oldala, a sitemap, a kanonikus tagek és az llms.txt mind mást mondanak, akkor a probléma nem az AI-bejárás. A probléma a governance.

<!-- tool-cta:start -->

💡 Próbálja ki ezt: Mivel az llms.txt nem kényszeríthető ki, párosítsa kikényszeríthető szabályokkal, és ellenőrizze őket a Robots.txt Tester eszközben, hogy a szabványokat betartó crawlerek megfelelően viselkedjenek.

<!-- tool-cta:end -->

Záró ajánlás

Ha a webhelyünkön dokumentáció, szerkesztőségi tartalom vagy licencelési kérdés található, hozzunk létre egy egyszerű llms.txt-t. Tartsuk néhány tucat sor alatt. Használjuk arra, hogy kanonikus erőforrásokra mutasson, és megfogalmazza az újrafelhasználási preferenciáinkat.

De ne keverjük össze a kommunikációt az irányítással.

Blokkoláshoz használjuk a rendelkezésünkre álló bejárómechanizmusokat, és értsük meg a korlátaikat. Szabályzathoz tegyünk közzé világos feltételeket. Bizalomhoz legyünk átláthatók az olvasókkal. Az llms.txt ebbe a rendszerbe tartozik hasznos jelzésként — nem pajzsként.

Gyakran ismételt kérdések

Az llms.txt hivatalos szabvány?
Nem. Kialakulóban lévő javaslat és konvenció, nem formális webes szabvány, mint az RFC 9309-ben leírt robots.txt protokoll.
Megakadályozza az llms.txt, hogy AI-vállalatok a tartalmamon tanítsanak?
Nem megbízhatóan. Megfogalmazhatjuk a preferenciánkat, de a megfelelés a bejárótól vagy az AI-vállalattól függ. Használjunk robots.txt-t, hozzáférés-szabályozást, licencfeltételeket és jogi útmutatást, ahol erősebb kontrollokra van szükség.
Hová tegyem az llms.txt-t?
Helyezzük a domain gyökerébe, például ide: https://example.com/llms.txt, és gondoskodjunk róla, hogy nyilvánosan elérhető legyen egyszerű szöveges vagy Markdown-stílusú fájlként.
Tartalmaznia kell az llms.txt-nek a webhelyem minden oldalát?
Nem. A leginkább mérvadó és stabil erőforrásokra kell mutatnia. Egy rövid, válogatott fájl hasznosabb, mint egy hosszú, duplikált sitemap.
Segít az llms.txt a SEO-ban?
Nincs bevett rangsorolási előnye. Az értéke közvetett: világosabb kanonikus oldalak, jobb AI-nak szánt kontextus és nyilvános tartalomfelhasználási szabályzat.

Források és további olvasmányok

  1. llms.txt proposal
  2. RFC 9309: Robots Exclusion Protocol
  3. Google Search Central: robots.txt introduction and guide
  4. OpenAI: Web crawlers and user agents
A szerzőről
The Wux Webtools Team

Utolsó frissítés:

Tovább olvasom