Wie man llms.txt schreibt – und ob es tatsächlich etwas bewirkt
Ein praktischer Leitfaden zu der aufkommenden Datei für KI-Crawler, Inhaltszusammenfassungen und an Modelle gerichtete Website-Anweisungen.
Inhaltsverzeichnis
- Die Kurzfassung
- Welches Problem llms.txt lösen soll
- Bewirkt llms.txt tatsächlich etwas?
- Es blockiert KI-Crawler nicht zuverlässig
- Es kann bei der Interpretation helfen
- Es kann Ihre Inhaltsrichtlinie verdeutlichen
- Was in llms.txt stehen sollte
- Was nicht in llms.txt stehen sollte
- Wie llms.txt mit robots.txt zusammenhängt
- Ein praktischer Schreibprozess
- 1. Entscheiden Sie, welche Aufgabe die Datei hat
- 2. Identifizieren Sie kanonische Seiten
- 3. Schreiben Sie für Maschinen und Menschen
- 4. Fügen Sie Richtlinientext mit Bedacht hinzu
- 5. Veröffentlichen und pflegen Sie die Datei
- Sollte jede Website eine haben?
- SEO-Auswirkungen
- Eine abschließende Empfehlung
Die Kurzfassung
llms.txt ist eine aufkommende Konvention, um großen Sprachmodellen mitzuteilen, worum es auf Ihrer Website geht, welche Seiten wichtig sind und wie Ihre Inhalte verstanden werden sollen. Die Datei liegt in der Regel unter https://example.com/llms.txt, ist in Markdown geschrieben und verlinkt auf saubere, nützliche Ressourcen.
Sie ist nicht dasselbe wie robots.txt. Sie ist kein offizieller Webstandard. Sie blockiert KI-Training nicht zuverlässig. Sie zwingt kein KI-Unternehmen, Ihren Wünschen zu folgen.
Trotzdem kann es sich lohnen, eine solche Datei zu schreiben.
Eine gute llms.txt ist eine kostengünstige Möglichkeit, Ihre Website für KI-Systeme, Agenten, Suchassistenten und interne Tools leichter korrekt zusammenfassbar zu machen. Sie ist auch ein nützlicher Zwang zur Klärung: Sie müssen entscheiden, welche Inhalte kanonisch sind, welche veraltet sind und welche Bedingungen für die Wiederverwendung gelten. Das ist hilfreich, selbst wenn derzeit nur wenige Systeme die Datei lesen.
Welches Problem llms.txt lösen soll
Die meisten Websites sind für Menschen und Suchcrawler gebaut. Sie enthalten Navigation, Cookie-Banner, Produktkarten, doppelte Kategorieseiten, alte PDFs, Tracking-Parameter und Inhalte, die nur visuell Sinn ergeben.
LLMs brauchen nicht dieselbe Darstellungsebene. Sie brauchen:
- eine knappe Beschreibung der Website;
- Links zu den maßgeblichsten Seiten;
- verständlichen Kontext zu Produkten, Dokumentation, Richtlinien oder Autorenschaft;
- Lizenzierungs- und Nutzungspräferenzen;
- Hinweise auf strukturierte oder Markdown-Versionen, sofern verfügbar.
Der Vorschlag für llms.txt übernimmt eine vertraute Webidee: eine vorhersehbare Textdatei im Stammverzeichnis der Domain ablegen. Anders als robots.txt, das vor allem Crawl-Berechtigungen betrifft, dient llms.txt hauptsächlich der Orientierung.
Betrachten Sie es als Karte, nicht als Tor.
Bewirkt llms.txt tatsächlich etwas?
Die ehrliche Antwort lautet derzeit: manchmal, aber nicht so, wie viele es sich erhoffen.
Es blockiert KI-Crawler nicht zuverlässig
Wenn Ihr Ziel darin besteht, Crawling oder Training zu verhindern, ist llms.txt der falsche primäre Mechanismus. Crawler, die Ausschlussregeln respektieren, schauen eher auf robots.txt, spezifische User-Agent-Anweisungen, HTTP-Header oder vertragliche bzw. lizenzrechtliche Signale. Selbst dann hängt die Einhaltung vom Betreiber des Crawlers ab.
Das Web hat hier eine lange Geschichte. robots.txt selbst ist ein freiwilliges Protokoll, das später in RFC 9309 formalisiert wurde. Es funktioniert, weil große Crawler sich dafür entscheiden, es zu beachten – nicht weil die Datei magische Durchsetzungskraft hätte.
llms.txt hat weniger Verbreitung und weniger Standardisierung als robots.txt. Behandeln Sie jede Behauptung, es „schütze Ihre Inhalte vor KI“, mit Skepsis.
Es kann bei der Interpretation helfen
Wo llms.txt vielversprechender ist, ist die Interpretation von Inhalten.
Wenn ein KI-Assistent Fragen zu Ihrem Unternehmen, Ihrer Dokumentation, Forschung, Preisgestaltung, API oder redaktionellen Richtlinie beantworten soll, kann eine knappe Datei auf Root-Ebene das Raten reduzieren. Sie kann das System zu den Seiten führen, die Sie tatsächlich pflegen, und weg von veralteten Fragmenten.
Das ist besonders wichtig für Websites mit großen Archiven. Ein Modell oder Agent findet vielleicht einen Supportartikel von 2019, bevor es eine Richtlinienseite von 2026 findet. Ihre llms.txt kann sinngemäß sagen: „Hier beginnen. Das sind die maßgeblichen Ressourcen.“
Das ist nicht glamourös, aber nützlich.
Es kann Ihre Inhaltsrichtlinie verdeutlichen
Eine öffentliche, an KI gerichtete Richtlinie ist besser als Schweigen, besonders für Publisher, Dokumentationsteams und Unternehmen mit sensiblem Markenmaterial oder medizinischen, rechtlichen oder finanziellen Inhalten.
Das bedeutet nicht, dass Sie eine drohende Wand aus juristischem Text schreiben sollten. Es bedeutet, dass Sie klar festhalten können:
- ob KI-Systeme Ihre öffentlichen Seiten zusammenfassen dürfen;
- ob Ihre Inhalte für Modelltraining verwendet werden dürfen;
- wie Sie Attribution gehandhabt sehen möchten;
- welche Seiten als kanonisch gelten sollen;
- wen man für Lizenzierung oder Datenpartnerschaften kontaktieren soll.
Das passt gut zu breiterer redaktioneller Transparenz. Wenn Sie KI-unterstützte Inhalte veröffentlichen, sollte Ihre llms.txt Ihrer öffentlichen Offenlegung nicht widersprechen. Eine praktische Grundlage finden Sie in unserem Leitfaden zu ehrlicher KI-Offenlegung auf einer kleinen Website.
Was in llms.txt stehen sollte
Es gibt kein universell durchgesetztes Schema, aber die derzeitige Konvention ist Markdown. Halten Sie die Datei kurz, ausdrücklich und unspektakulär.
Eine nützliche Struktur sieht so aus:
# Example Company
> Example Company publishes practical guides and reference material for independent web developers.
## Canonical resources
- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/
## Content use policy
Public pages may be summarized with attribution to Example Company and a link to the source page.
Use of our content for model training, dataset creation, or bulk republication requires written permission.
## Preferred citation
When citing our content, link to the canonical URL and include the page title.
## Notes for AI systems
- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.
Das reicht für viele Websites aus.
Für größere Websites können Sie Abschnitte für Produktbereiche, API-Dokumentation, Forschung, Presseseiten oder rechtliche Richtlinien hinzufügen. Widerstehen Sie dem Impuls, alles aufzulisten. Je umfassender die Datei wird, desto weniger nützlich ist sie als Ausgangspunkt.
Was nicht in llms.txt stehen sollte
Legen Sie darin keine privaten Informationen ab. Das klingt offensichtlich, aber Textdateien im Stammverzeichnis werden oft zu Sammelstellen für betriebliche Notizen.
Vermeiden Sie insbesondere:
- unveröffentlichte URLs;
- interne Staging-Links;
- API-Schlüssel oder Tokens;
- private Kontaktdaten;
- Sicherheitsanweisungen;
- embargoierte Produktinformationen;
- „geheime“ Seiten, von denen Sie hoffen, dass Crawler sie ignorieren.
Wenn etwas nicht öffentlich sein sollte, erwähnen Sie es nicht in einer öffentlichen Datei.
Vermeiden Sie außerdem vages juristisches Theater. „Jede KI-Nutzung ist für immer verboten“ mag Frustration ausdrücken, schafft aber keine zuverlässige technische Kontrolle. Wenn Ihre Organisation tatsächlich durchsetzbare Einschränkungen benötigt, ziehen Sie Rechtsberatung hinzu und nutzen Sie Crawler-Kontrollen, Lizenzbedingungen und Zugriffskontrollen gemeinsam.
Wie llms.txt mit robots.txt zusammenhängt
Verwenden Sie robots.txt für Crawl-Anweisungen. Verwenden Sie llms.txt für Kontext.
Eine vereinfachte Aufteilung:
| Datei | Hauptzweck | Durchsetzbar? | Am besten geeignet für | |---|---|---:|---| | robots.txt | Crawl-Berechtigungen | Freiwillig, aber breit anerkannt | Crawler nach Pfad und User Agent erlauben oder ausschließen | | llms.txt | An LLMs gerichtete Zusammenfassung und Hinweise | Derzeit nicht standardisiert | Kanonische Links, Inhaltsrichtlinie, Interpretationshinweise | | Terms page | Rechtliche Bedingungen | Abhängig von Rechtsordnung und Umständen | Lizenzierung, erlaubte Wiederverwendung, kommerzielle Einschränkungen | | HTTP headers | Technische Signale auf Seitenebene | Abhängig von Crawler-Unterstützung | Indexierung, Caching und Antwortverhalten |
Wenn Sie bereits Crawler-Verhalten debuggen, hören Sie nicht bei der Textdatei auf. Prüfen Sie, ob Ihre Website die Datei tatsächlich korrekt ausliefert, ob Weiterleitungen wie erwartet funktionieren und ob Header zu Ihrer Richtlinie passen. Wir haben einen separaten Leitfaden zum Debugging von Weiterleitungen und HTTP-Headern in der Produktion geschrieben, weil genau hier viele „Policy“-Entscheidungen leise scheitern.
Ein praktischer Schreibprozess
Hier ist ein sinnvoller Ablauf.
1. Entscheiden Sie, welche Aufgabe die Datei hat
Wählen Sie ein primäres Ziel:
- KI-Systemen helfen, Ihre Website korrekt zu beschreiben;
- Agenten zu aktueller Dokumentation führen;
- Präferenzen zur Wiederverwendung und Attribution festhalten;
- Verwirrung rund um archivierte oder nutzergenerierte Inhalte reduzieren.
Wenn Sie versuchen, mit llms.txt jedes Problem der KI-Governance zu lösen, wird sie keines davon lösen.
2. Identifizieren Sie kanonische Seiten
Wählen Sie die 5–20 URLs aus, die die Website am besten repräsentieren. Bevorzugen Sie stabile, gepflegte Seiten gegenüber trafficstarken Seiten. Für ein SaaS-Unternehmen können das Homepage, Dokumentation, Preise, Sicherheit, Datenschutz, API-Referenz, Status und Kontakt sein. Für einen Publisher können es Themen-Hubs, redaktionelle Standards, Autorenseiten, Korrekturrichtlinie und Lizenzierung sein.
3. Schreiben Sie für Maschinen und Menschen
Verwenden Sie klare Markdown-Überschriften. Vermeiden Sie Marketingtext. Sagen Sie in ein oder zwei Sätzen, was die Website ist.
Schlecht:
Wir revolutionieren die Zukunft digitaler Exzellenz mit Lösungen der nächsten Generation.
Besser:
Acme Docs veröffentlicht technische Dokumentation für Acmes payments API, einschließlich Authentifizierung, Webhooks, SDKs und Migrationsleitfäden.
4. Fügen Sie Richtlinientext mit Bedacht hinzu
Ihr Richtlinienabschnitt sollte verständlich sein, ohne übertrieben selbstsicher zu klingen. Zum Beispiel:
Öffentliche Seiten dürfen für Suche, Barrierefreiheit und Nutzerunterstützung mit Attribution zusammengefasst werden. Massenkopien, Dataset-Erstellung oder Modelltraining erfordern eine Genehmigung.
Das garantiert keine Einhaltung, ist aber klarer als Schweigen.
5. Veröffentlichen und pflegen Sie die Datei
Legen Sie sie unter /llms.txt ab. Liefern Sie sie als text/plain oder als kompatible Textantwort aus. Verlinken Sie nur auf kanonische URLs. Überprüfen Sie sie, wenn sich Ihre Informationsarchitektur ändert.
Eine veraltete llms.txt ist schlimmer als gar keine Datei, weil sie selbstbewusste Anweisungen gibt, die nicht mehr stimmen.
Sollte jede Website eine haben?
Nein.
Eine fünfseitige Broschüren-Website braucht wahrscheinlich keine llms.txt. Ein lokales Restaurant braucht keine, es sei denn, es hat strukturierte Richtlinien oder Buchungsinformationen, die KI-Assistenten häufig falsch wiedergeben.
Nützlicher wird sie, wenn:
- Ihre Website viel Dokumentation enthält;
- alte Inhalte mit neuen Inhalten konkurrieren;
- Sie Forschungs- oder redaktionelles Material veröffentlichen;
- Lizenzierung und Attribution wichtig sind;
- KI-Assistenten Ihre Seiten häufig zusammenfassen;
- interne Teams eine gemeinsame Richtlinie für öffentliche Inhalte benötigen.
Sie ist auch als Teil einer internen Governance-Übung nützlich. Viele Unternehmen haben bereits Mitarbeitende, die Webseiten, Dokumente und Kundenmaterial in KI-Systeme einfügen. Wenn Ihnen das bekannt vorkommt, führen Sie zunächst ein grundlegendes Shadow-AI-Audit durch, bevor Sie annehmen, dass eine öffentliche Textdatei das Risiko behebt.
SEO-Auswirkungen
llms.txt ist in keinem etablierten Sinn ein Rankingfaktor. Schreiben Sie keine, weil Sie nächste Woche einen Traffic-Schub erwarten.
Der indirekte SEO-Fall ist bescheidener:
- sie erzwingt kanonisches Denken;
- sie kann KI-vermittelten Such- und Antwortsystemen helfen, Ihre Website zu verstehen;
- sie verdeutlicht Attributionspräferenzen;
- sie reduziert Mehrdeutigkeit rund um archivierte Seiten;
- sie schafft eine öffentliche, überprüfbare Richtlinie zur Inhaltsnutzung durch KI.
Das ist für manche Websites wertvoll. Es ist keine magische Optimierungsebene.
Die beste Version von llms.txt ist klein, aktuell und auf den Rest Ihrer Website abgestimmt. Wenn Ihre Robots-Regeln, Terms page, Sitemap, Canonical Tags und llms.txt alle Unterschiedliches sagen, ist das Problem nicht KI-Crawling. Das Problem ist Governance.
<!-- tool-cta:start -->
💡 Probieren Sie dies aus: Da llms.txt nicht durchsetzbar ist, kombinieren Sie es mit durchsetzbaren Regeln und prüfen Sie diese im Robots.txt Tester, damit Crawler, die Standards befolgen, sich korrekt verhalten.
<!-- tool-cta:end -->
Eine abschließende Empfehlung
Wenn Ihre Website Dokumentation, redaktionelle Inhalte oder Lizenzierungsfragen hat, erstellen Sie eine einfache llms.txt. Halten Sie sie unter einigen Dutzend Zeilen. Nutzen Sie sie, um auf kanonische Ressourcen zu verweisen und Ihre Präferenzen zur Wiederverwendung festzuhalten.
Verwechseln Sie Kommunikation aber nicht mit Kontrolle.
Zum Blockieren nutzen Sie die Ihnen verfügbaren Crawler-Mechanismen und verstehen Sie deren Grenzen. Für Richtlinien veröffentlichen Sie klare Bedingungen. Für Vertrauen seien Sie gegenüber Lesern transparent. llms.txt gehört in diesen Werkzeugkasten als hilfreiches Signal – nicht als Schutzschild.