SEO & Discoverability

Hoe je llms.txt schrijft—en of het eigenlijk iets doet

Een praktische gids voor het opkomende bestand voor AI-crawlers, contentsamenvattingen en site-instructies voor modellen.

The Wux Webtools Team The Wux Webtools Team 9 min lezen AI-ondersteund, door mensen beoordeeld
Abstract illustration of an llms.txt file guiding AI crawler paths through a website structure.
Inhoudsopgave
  1. De korte versie
  2. Wat llms.txt moet oplossen
  3. Doet llms.txt echt iets?
  4. Het blokkeert AI-crawlers niet betrouwbaar
  5. Het kan helpen bij interpretatie
  6. Het kan je contentbeleid verduidelijken
  7. Wat je in llms.txt zet
  8. Wat je niet in llms.txt zet
  9. Hoe llms.txt zich verhoudt tot robots.txt
  10. Een praktisch schrijfproces
  11. 1. Bepaal de taak van het bestand
  12. 2. Identificeer canonieke pagina’s
  13. 3. Schrijf voor machines en mensen
  14. 4. Voeg beleidstaal zorgvuldig toe
  15. 5. Publiceer en onderhoud het
  16. Moet elke site er een hebben?
  17. SEO-implicaties
  18. Een laatste aanbeveling

De korte versie

llms.txt is een opkomende conventie om grote taalmodellen te vertellen wat je site is, welke pagina’s belangrijk zijn en hoe je content moet worden begrepen. Het bestand staat meestal op https://example.com/llms.txt, is geschreven in Markdown en linkt naar schone, nuttige bronnen.

Het is niet hetzelfde als robots.txt. Het is geen officiële webstandaard. Het blokkeert AI-training niet betrouwbaar. Het dwingt een AI-bedrijf niet om je wensen te volgen.

Toch kan het de moeite waard zijn om er een te schrijven.

Een goede llms.txt is een goedkope manier om je site makkelijker correct te laten samenvatten door AI-systemen, agents, zoekassistenten en interne tools. Het dwingt ook tot keuzes: je moet bepalen welke content canoniek is, welke content verouderd is en welke voorwaarden gelden voor hergebruik. Dat is nuttig, zelfs als momenteel maar een paar systemen het bestand lezen.

Wat llms.txt moet oplossen

De meeste websites zijn gebouwd voor mensen en zoekcrawlers. Ze bevatten navigatie, cookiebanners, productkaarten, dubbele categoriepagina’s, oude PDF’s, trackingparameters en content die alleen visueel logisch is.

LLM’s hebben niet dezelfde presentatielaag nodig. Ze hebben nodig:

  • een beknopte beschrijving van de site;
  • links naar de meest gezaghebbende pagina’s;
  • context in gewone taal over producten, documentatie, beleid of auteurschap;
  • licentie- en gebruiksvoorkeuren;
  • verwijzingen naar gestructureerde of Markdown-versies waar beschikbaar.

Het llms.txt-voorstel leent een bekend webidee: plaats een voorspelbaar tekstbestand in de root van het domein. Anders dan robots.txt, dat vooral over crawltoestemmingen gaat, draait llms.txt vooral om oriëntatie.

Zie het als een kaart, niet als een poort.

Doet llms.txt echt iets?

Vandaag is het eerlijke antwoord: soms, maar niet op de manier waarop veel mensen hopen.

Het blokkeert AI-crawlers niet betrouwbaar

Als je doel is om crawlen of trainen te voorkomen, is llms.txt het verkeerde primaire mechanisme. Crawlers die uitsluitingsregels respecteren, zullen eerder kijken naar robots.txt, specifieke user-agent-richtlijnen, HTTP-headers of contractuele/licentiesignalen. Zelfs dan hangt naleving af van de crawlerbeheerder.

Het web heeft hier een lange geschiedenis mee. robots.txt zelf is een vrijwillig protocol, later geformaliseerd in RFC 9309. Het werkt omdat grote crawlers ervoor kiezen het te respecteren, niet omdat het bestand magische afdwingingskracht heeft.

llms.txt heeft minder adoptie en minder standaardisatie dan robots.txt. Behandel elke claim dat het “je content beschermt tegen AI” met argwaan.

Het kan helpen bij interpretatie

Waar llms.txt veelbelovender is, is contentinterpretatie.

Als een AI-assistent vragen probeert te beantwoorden over je bedrijf, documentatie, onderzoek, prijzen, API of redactioneel beleid, kan een beknopt bestand op rootniveau giswerk verminderen. Het kan het systeem naar de pagina’s sturen die je daadwerkelijk onderhoudt en weg van verouderde fragmenten.

Dit is belangrijk voor sites met grote archieven. Een model of agent kan een supportartikel uit 2019 vinden vóór een beleidspagina uit 2026. Je llms.txt kan in feite zeggen: “Begin hier. Dit zijn de gezaghebbende bronnen.”

Dat is niet glamoureus, maar wel nuttig.

Het kan je contentbeleid verduidelijken

Een openbaar AI-gericht beleid is beter dan stilte, vooral voor uitgevers, documentatieteams en bedrijven met gevoelig merk-, medisch, juridisch of financieel materiaal.

Dit betekent niet dat je een dreigende muur juridische tekst moet schrijven. Het betekent dat je helder kunt aangeven:

  • of AI-systemen je openbare pagina’s mogen samenvatten;
  • of je content mag worden gebruikt voor modeltraining;
  • hoe je wilt dat attributie wordt behandeld;
  • welke pagina’s als canoniek moeten worden beschouwd;
  • met wie men contact kan opnemen voor licenties of data-partnerships.

Dit past goed bij bredere redactionele transparantie. Als je AI-ondersteunde content publiceert, mag je llms.txt je openbare toelichting niet tegenspreken. Zie voor een praktische basislijn onze gids over eerlijke AI-vermelding op een kleine website.

Wat je in llms.txt zet

Er is geen universeel afgedwongen schema, maar de huidige conventie is Markdown. Houd het kort, expliciet en saai.

Een nuttige structuur ziet er zo uit:

# Example Company

> Example Company publishes practical guides and reference material for independent web developers.

## Canonical resources

- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/

## Content use policy

Public pages may be summarized with attribution to Example Company and a link to the source page.

Use of our content for model training, dataset creation, or bulk republication requires written permission.

## Preferred citation

When citing our content, link to the canonical URL and include the page title.

## Notes for AI systems

- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.

Dat is genoeg voor veel sites.

Voeg voor grotere sites secties toe voor productgebieden, API-documentatie, onderzoek, perspagina’s of juridisch beleid. Weersta de neiging om alles op te sommen. Hoe vollediger het bestand wordt, hoe minder nuttig het is als startpunt.

Wat je niet in llms.txt zet

Zet er geen privé-informatie in. Dit klinkt vanzelfsprekend, maar tekstbestanden op rootniveau worden vaak verzamelplekken voor operationele notities.

Vermijd het opnemen van:

  • niet-gepubliceerde URL’s;
  • interne staging-links;
  • API-sleutels of tokens;
  • privécontactgegevens;
  • beveiligingsinstructies;
  • productinformatie onder embargo;
  • “geheime” pagina’s waarvan je hoopt dat crawlers ze zullen negeren.

Als iets niet openbaar mag zijn, noem het dan niet in een openbaar bestand.

Vermijd ook vaag juridisch theater. “Alle AI-gebruik is voor altijd verboden” kan frustratie uitdrukken, maar het creëert geen betrouwbare technische controle. Als je organisatie echt afdwingbare beperkingen nodig heeft, betrek dan juridisch advies en gebruik crawlercontroles, licentievoorwaarden en toegangscontroles samen.

Hoe llms.txt zich verhoudt tot robots.txt

Gebruik robots.txt voor crawlrichtlijnen. Gebruik llms.txt voor context.

Een vereenvoudigde verdeling:

| Bestand | Hoofddoel | Afdwingbaar? | Best gebruikt voor | |---|---|---:|---| | robots.txt | Crawltoestemmingen | Vrijwillig maar breed erkend | Crawlers toestaan of blokkeren per pad en user agent | | llms.txt | Samenvatting en richtlijnen voor LLM’s | Momenteel niet gestandaardiseerd | Canonieke links, contentbeleid, interpretatienotities | | Voorwaardenpagina | Juridische voorwaarden | Hangt af van jurisdictie en feiten | Licenties, toegestaan hergebruik, commerciële beperkingen | | HTTP-headers | Technische signalen op paginaniveau | Hangt af van crawlerondersteuning | Indexering, caching en responsgedrag |

Als je al crawlergedrag aan het debuggen bent, stop dan niet bij het tekstbestand. Controleer of je site het bestand daadwerkelijk correct serveert, of redirects zich gedragen zoals verwacht en of headers overeenkomen met je beleid. We schreven een aparte gids over redirects en HTTP-headers debuggen in productie, omdat hier veel “beleidsbeslissingen” stilletjes mislukken.

Een praktisch schrijfproces

Dit is een verstandige workflow.

1. Bepaal de taak van het bestand

Kies één primair doel:

  • AI-systemen helpen je site accuraat te beschrijven;
  • agents naar actuele documentatie leiden;
  • voorkeuren voor hergebruik en attributie vastleggen;
  • verwarring rond gearchiveerde of door gebruikers gegenereerde content verminderen.

Als je probeert llms.txt elk AI-governanceprobleem te laten oplossen, lost het er geen enkel op.

2. Identificeer canonieke pagina’s

Kies de 5–20 URL’s die de site het best vertegenwoordigen. Geef de voorkeur aan stabiele, onderhouden pagina’s boven pagina’s met veel verkeer. Voor een SaaS-bedrijf kunnen dat de homepage, documentatie, prijzen, beveiliging, privacy, API-referentie, status en contact zijn. Voor een uitgever kunnen dat onderwerp-hubs, redactionele standaarden, auteurspagina’s, correctiebeleid en licenties zijn.

3. Schrijf voor machines en mensen

Gebruik duidelijke Markdown-koppen. Vermijd marketingtaal. Zeg in één of twee zinnen wat de site is.

Slecht:

We revolutioneren de toekomst van digitale excellentie met oplossingen van de volgende generatie.

Beter:

Acme Docs publiceert technische documentatie voor Acme’s payments API, inclusief authenticatie, webhooks, SDKs en migratiegidsen.

4. Voeg beleidstaal zorgvuldig toe

Je beleidssectie moet begrijpelijk zijn zonder te stellig te zijn. Bijvoorbeeld:

Openbare pagina’s mogen worden samengevat voor zoeken, toegankelijkheid en gebruikersondersteuning met attributie. Bulk-kopiëren, datasetcreatie of modeltraining vereist toestemming.

Dat garandeert geen naleving, maar het is duidelijker dan stilte.

5. Publiceer en onderhoud het

Plaats het op /llms.txt. Serveer het als text/plain of een compatibele tekstrespons. Link alleen naar canonieke URL’s. Controleer het wanneer je informatiearchitectuur verandert.

Een verouderde llms.txt is slechter dan geen bestand, omdat het zelfverzekerde instructies geeft die niet langer waar zijn.

Moet elke site er een hebben?

Nee.

Een brochuresite van vijf pagina’s heeft waarschijnlijk geen llms.txt nodig. Een lokaal restaurant heeft er geen nodig, tenzij het gestructureerd beleid of boekingsinformatie heeft die AI-assistenten vaak verkeerd weergeven.

Het wordt nuttiger wanneer:

  • je site veel documentatie heeft;
  • oude content concurreert met nieuwe content;
  • je onderzoek of redactioneel materiaal publiceert;
  • licenties en attributie belangrijk zijn;
  • AI-assistenten je pagina’s vaak samenvatten;
  • interne teams een gedeeld beleid nodig hebben voor openbare content.

Het is ook nuttig als onderdeel van een interne governance-oefening. Veel bedrijven hebben al medewerkers die webpagina’s, documenten en klantmateriaal in AI-systemen plakken. Als dat bekend klinkt, voer dan een basis-shadow AI-audit uit voordat je aanneemt dat een openbaar tekstbestand het risico oplost.

SEO-implicaties

llms.txt is in geen enkele gevestigde zin een rankingfactor. Schrijf er geen omdat je volgende week een verkeersboost verwacht.

De indirecte SEO-case is bescheidener:

  • het dwingt canoniek denken af;
  • het kan AI-gemedieerde zoek- en antwoordsystemen helpen je site te begrijpen;
  • het verduidelijkt attributievoorkeuren;
  • het vermindert ambiguïteit rond gearchiveerde pagina’s;
  • het creëert een openbaar, inspecteerbaar AI-contentbeleid.

Dat is voor sommige sites de moeite waard. Het is geen magische optimalisatielaag.

De beste versie van llms.txt is klein, actueel en afgestemd op de rest van je site. Als je robots-regels, voorwaardenpagina, sitemap, canonical tags en llms.txt allemaal iets anders zeggen, is AI-crawling niet het probleem. Het probleem is governance.

<!-- tool-cta:start -->

💡 Probeer dit: Omdat llms.txt niet afdwingbaar is, combineer je het met afdwingbare regels en controleer je die in Robots.txt Tester, zodat crawlers die zich aan standaarden houden zich correct gedragen.

<!-- tool-cta:end -->

Een laatste aanbeveling

Als je site documentatie, redactionele content of licentiekwesties heeft, maak dan een eenvoudige llms.txt. Houd het onder een paar dozijn regels. Gebruik het om naar canonieke bronnen te verwijzen en je hergebruikvoorkeuren vast te leggen.

Maar verwar communicatie niet met controle.

Gebruik voor blokkeren de crawlermechanismen die je tot je beschikking hebt en begrijp hun beperkingen. Publiceer duidelijke voorwaarden voor beleid. Wees transparant naar lezers voor vertrouwen. llms.txt hoort in die stack als een nuttig signaal—niet als een schild.

Veelgestelde vragen

Is llms.txt een officiële standaard?
Nee. Het is een opkomend voorstel en een conventie, geen formele webstandaard zoals het robots.txt-protocol dat in RFC 9309 wordt beschreven.
Zal llms.txt AI-bedrijven ervan weerhouden op mijn content te trainen?
Niet betrouwbaar. Je kunt je voorkeur aangeven, maar naleving hangt af van de crawler of het AI-bedrijf. Gebruik robots.txt, toegangscontroles, licentievoorwaarden en juridisch advies waar sterkere controles nodig zijn.
Waar moet ik llms.txt plaatsen?
Plaats het in de root van je domein, zoals https://example.com/llms.txt, en zorg dat het openbaar toegankelijk is als platte tekst of Markdown-achtig bestand.
Moet llms.txt elke pagina op mijn site bevatten?
Nee. Het moet verwijzen naar de meest gezaghebbende en stabiele bronnen. Een kort, samengesteld bestand is nuttiger dan een lange dubbele sitemap.
Helpt llms.txt bij SEO?
Er is geen gevestigd rankingvoordeel. De waarde is indirect: duidelijkere canonieke pagina’s, betere context voor AI en een openbaar beleid voor contentgebruik.

Bronnen & verder lezen

  1. llms.txt proposal
  2. RFC 9309: Robots Exclusion Protocol
  3. Google Search Central: robots.txt introduction and guide
  4. OpenAI: Web crawlers and user agents
Over de auteur
The Wux Webtools Team

Laatst bijgewerkt:

Blijf lezen