SEO & Discoverability

Wie man llms.txt schreibt – und ob es tatsächlich etwas bewirkt

Ein praktischer Leitfaden zu der aufkommenden Datei für KI-Crawler, Inhaltszusammenfassungen und an Modelle gerichtete Website-Anweisungen.

The Wux Webtools Team The Wux Webtools Team 9 min lesen KI-unterstützt, menschlich überprüft
Abstract illustration of an llms.txt file guiding AI crawler paths through a website structure.
Inhaltsverzeichnis
  1. Die Kurzfassung
  2. Welches Problem llms.txt lösen soll
  3. Bewirkt llms.txt tatsächlich etwas?
  4. Es blockiert KI-Crawler nicht zuverlässig
  5. Es kann bei der Interpretation helfen
  6. Es kann Ihre Inhaltsrichtlinie verdeutlichen
  7. Was in llms.txt stehen sollte
  8. Was nicht in llms.txt stehen sollte
  9. Wie llms.txt mit robots.txt zusammenhängt
  10. Ein praktischer Schreibprozess
  11. 1. Entscheiden Sie, welche Aufgabe die Datei hat
  12. 2. Identifizieren Sie kanonische Seiten
  13. 3. Schreiben Sie für Maschinen und Menschen
  14. 4. Fügen Sie Richtlinientext mit Bedacht hinzu
  15. 5. Veröffentlichen und pflegen Sie die Datei
  16. Sollte jede Website eine haben?
  17. SEO-Auswirkungen
  18. Eine abschließende Empfehlung

Die Kurzfassung

llms.txt ist eine aufkommende Konvention, um großen Sprachmodellen mitzuteilen, worum es auf Ihrer Website geht, welche Seiten wichtig sind und wie Ihre Inhalte verstanden werden sollen. Die Datei liegt in der Regel unter https://example.com/llms.txt, ist in Markdown geschrieben und verlinkt auf saubere, nützliche Ressourcen.

Sie ist nicht dasselbe wie robots.txt. Sie ist kein offizieller Webstandard. Sie blockiert KI-Training nicht zuverlässig. Sie zwingt kein KI-Unternehmen, Ihren Wünschen zu folgen.

Trotzdem kann es sich lohnen, eine solche Datei zu schreiben.

Eine gute llms.txt ist eine kostengünstige Möglichkeit, Ihre Website für KI-Systeme, Agenten, Suchassistenten und interne Tools leichter korrekt zusammenfassbar zu machen. Sie ist auch ein nützlicher Zwang zur Klärung: Sie müssen entscheiden, welche Inhalte kanonisch sind, welche veraltet sind und welche Bedingungen für die Wiederverwendung gelten. Das ist hilfreich, selbst wenn derzeit nur wenige Systeme die Datei lesen.

Welches Problem llms.txt lösen soll

Die meisten Websites sind für Menschen und Suchcrawler gebaut. Sie enthalten Navigation, Cookie-Banner, Produktkarten, doppelte Kategorieseiten, alte PDFs, Tracking-Parameter und Inhalte, die nur visuell Sinn ergeben.

LLMs brauchen nicht dieselbe Darstellungsebene. Sie brauchen:

  • eine knappe Beschreibung der Website;
  • Links zu den maßgeblichsten Seiten;
  • verständlichen Kontext zu Produkten, Dokumentation, Richtlinien oder Autorenschaft;
  • Lizenzierungs- und Nutzungspräferenzen;
  • Hinweise auf strukturierte oder Markdown-Versionen, sofern verfügbar.

Der Vorschlag für llms.txt übernimmt eine vertraute Webidee: eine vorhersehbare Textdatei im Stammverzeichnis der Domain ablegen. Anders als robots.txt, das vor allem Crawl-Berechtigungen betrifft, dient llms.txt hauptsächlich der Orientierung.

Betrachten Sie es als Karte, nicht als Tor.

Bewirkt llms.txt tatsächlich etwas?

Die ehrliche Antwort lautet derzeit: manchmal, aber nicht so, wie viele es sich erhoffen.

Es blockiert KI-Crawler nicht zuverlässig

Wenn Ihr Ziel darin besteht, Crawling oder Training zu verhindern, ist llms.txt der falsche primäre Mechanismus. Crawler, die Ausschlussregeln respektieren, schauen eher auf robots.txt, spezifische User-Agent-Anweisungen, HTTP-Header oder vertragliche bzw. lizenzrechtliche Signale. Selbst dann hängt die Einhaltung vom Betreiber des Crawlers ab.

Das Web hat hier eine lange Geschichte. robots.txt selbst ist ein freiwilliges Protokoll, das später in RFC 9309 formalisiert wurde. Es funktioniert, weil große Crawler sich dafür entscheiden, es zu beachten – nicht weil die Datei magische Durchsetzungskraft hätte.

llms.txt hat weniger Verbreitung und weniger Standardisierung als robots.txt. Behandeln Sie jede Behauptung, es „schütze Ihre Inhalte vor KI“, mit Skepsis.

Es kann bei der Interpretation helfen

Wo llms.txt vielversprechender ist, ist die Interpretation von Inhalten.

Wenn ein KI-Assistent Fragen zu Ihrem Unternehmen, Ihrer Dokumentation, Forschung, Preisgestaltung, API oder redaktionellen Richtlinie beantworten soll, kann eine knappe Datei auf Root-Ebene das Raten reduzieren. Sie kann das System zu den Seiten führen, die Sie tatsächlich pflegen, und weg von veralteten Fragmenten.

Das ist besonders wichtig für Websites mit großen Archiven. Ein Modell oder Agent findet vielleicht einen Supportartikel von 2019, bevor es eine Richtlinienseite von 2026 findet. Ihre llms.txt kann sinngemäß sagen: „Hier beginnen. Das sind die maßgeblichen Ressourcen.“

Das ist nicht glamourös, aber nützlich.

Es kann Ihre Inhaltsrichtlinie verdeutlichen

Eine öffentliche, an KI gerichtete Richtlinie ist besser als Schweigen, besonders für Publisher, Dokumentationsteams und Unternehmen mit sensiblem Markenmaterial oder medizinischen, rechtlichen oder finanziellen Inhalten.

Das bedeutet nicht, dass Sie eine drohende Wand aus juristischem Text schreiben sollten. Es bedeutet, dass Sie klar festhalten können:

  • ob KI-Systeme Ihre öffentlichen Seiten zusammenfassen dürfen;
  • ob Ihre Inhalte für Modelltraining verwendet werden dürfen;
  • wie Sie Attribution gehandhabt sehen möchten;
  • welche Seiten als kanonisch gelten sollen;
  • wen man für Lizenzierung oder Datenpartnerschaften kontaktieren soll.

Das passt gut zu breiterer redaktioneller Transparenz. Wenn Sie KI-unterstützte Inhalte veröffentlichen, sollte Ihre llms.txt Ihrer öffentlichen Offenlegung nicht widersprechen. Eine praktische Grundlage finden Sie in unserem Leitfaden zu ehrlicher KI-Offenlegung auf einer kleinen Website.

Was in llms.txt stehen sollte

Es gibt kein universell durchgesetztes Schema, aber die derzeitige Konvention ist Markdown. Halten Sie die Datei kurz, ausdrücklich und unspektakulär.

Eine nützliche Struktur sieht so aus:

# Example Company

> Example Company publishes practical guides and reference material for independent web developers.

## Canonical resources

- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/

## Content use policy

Public pages may be summarized with attribution to Example Company and a link to the source page.

Use of our content for model training, dataset creation, or bulk republication requires written permission.

## Preferred citation

When citing our content, link to the canonical URL and include the page title.

## Notes for AI systems

- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.

Das reicht für viele Websites aus.

Für größere Websites können Sie Abschnitte für Produktbereiche, API-Dokumentation, Forschung, Presseseiten oder rechtliche Richtlinien hinzufügen. Widerstehen Sie dem Impuls, alles aufzulisten. Je umfassender die Datei wird, desto weniger nützlich ist sie als Ausgangspunkt.

Was nicht in llms.txt stehen sollte

Legen Sie darin keine privaten Informationen ab. Das klingt offensichtlich, aber Textdateien im Stammverzeichnis werden oft zu Sammelstellen für betriebliche Notizen.

Vermeiden Sie insbesondere:

  • unveröffentlichte URLs;
  • interne Staging-Links;
  • API-Schlüssel oder Tokens;
  • private Kontaktdaten;
  • Sicherheitsanweisungen;
  • embargoierte Produktinformationen;
  • „geheime“ Seiten, von denen Sie hoffen, dass Crawler sie ignorieren.

Wenn etwas nicht öffentlich sein sollte, erwähnen Sie es nicht in einer öffentlichen Datei.

Vermeiden Sie außerdem vages juristisches Theater. „Jede KI-Nutzung ist für immer verboten“ mag Frustration ausdrücken, schafft aber keine zuverlässige technische Kontrolle. Wenn Ihre Organisation tatsächlich durchsetzbare Einschränkungen benötigt, ziehen Sie Rechtsberatung hinzu und nutzen Sie Crawler-Kontrollen, Lizenzbedingungen und Zugriffskontrollen gemeinsam.

Wie llms.txt mit robots.txt zusammenhängt

Verwenden Sie robots.txt für Crawl-Anweisungen. Verwenden Sie llms.txt für Kontext.

Eine vereinfachte Aufteilung:

| Datei | Hauptzweck | Durchsetzbar? | Am besten geeignet für | |---|---|---:|---| | robots.txt | Crawl-Berechtigungen | Freiwillig, aber breit anerkannt | Crawler nach Pfad und User Agent erlauben oder ausschließen | | llms.txt | An LLMs gerichtete Zusammenfassung und Hinweise | Derzeit nicht standardisiert | Kanonische Links, Inhaltsrichtlinie, Interpretationshinweise | | Terms page | Rechtliche Bedingungen | Abhängig von Rechtsordnung und Umständen | Lizenzierung, erlaubte Wiederverwendung, kommerzielle Einschränkungen | | HTTP headers | Technische Signale auf Seitenebene | Abhängig von Crawler-Unterstützung | Indexierung, Caching und Antwortverhalten |

Wenn Sie bereits Crawler-Verhalten debuggen, hören Sie nicht bei der Textdatei auf. Prüfen Sie, ob Ihre Website die Datei tatsächlich korrekt ausliefert, ob Weiterleitungen wie erwartet funktionieren und ob Header zu Ihrer Richtlinie passen. Wir haben einen separaten Leitfaden zum Debugging von Weiterleitungen und HTTP-Headern in der Produktion geschrieben, weil genau hier viele „Policy“-Entscheidungen leise scheitern.

Ein praktischer Schreibprozess

Hier ist ein sinnvoller Ablauf.

1. Entscheiden Sie, welche Aufgabe die Datei hat

Wählen Sie ein primäres Ziel:

  • KI-Systemen helfen, Ihre Website korrekt zu beschreiben;
  • Agenten zu aktueller Dokumentation führen;
  • Präferenzen zur Wiederverwendung und Attribution festhalten;
  • Verwirrung rund um archivierte oder nutzergenerierte Inhalte reduzieren.

Wenn Sie versuchen, mit llms.txt jedes Problem der KI-Governance zu lösen, wird sie keines davon lösen.

2. Identifizieren Sie kanonische Seiten

Wählen Sie die 5–20 URLs aus, die die Website am besten repräsentieren. Bevorzugen Sie stabile, gepflegte Seiten gegenüber trafficstarken Seiten. Für ein SaaS-Unternehmen können das Homepage, Dokumentation, Preise, Sicherheit, Datenschutz, API-Referenz, Status und Kontakt sein. Für einen Publisher können es Themen-Hubs, redaktionelle Standards, Autorenseiten, Korrekturrichtlinie und Lizenzierung sein.

3. Schreiben Sie für Maschinen und Menschen

Verwenden Sie klare Markdown-Überschriften. Vermeiden Sie Marketingtext. Sagen Sie in ein oder zwei Sätzen, was die Website ist.

Schlecht:

Wir revolutionieren die Zukunft digitaler Exzellenz mit Lösungen der nächsten Generation.

Besser:

Acme Docs veröffentlicht technische Dokumentation für Acmes payments API, einschließlich Authentifizierung, Webhooks, SDKs und Migrationsleitfäden.

4. Fügen Sie Richtlinientext mit Bedacht hinzu

Ihr Richtlinienabschnitt sollte verständlich sein, ohne übertrieben selbstsicher zu klingen. Zum Beispiel:

Öffentliche Seiten dürfen für Suche, Barrierefreiheit und Nutzerunterstützung mit Attribution zusammengefasst werden. Massenkopien, Dataset-Erstellung oder Modelltraining erfordern eine Genehmigung.

Das garantiert keine Einhaltung, ist aber klarer als Schweigen.

5. Veröffentlichen und pflegen Sie die Datei

Legen Sie sie unter /llms.txt ab. Liefern Sie sie als text/plain oder als kompatible Textantwort aus. Verlinken Sie nur auf kanonische URLs. Überprüfen Sie sie, wenn sich Ihre Informationsarchitektur ändert.

Eine veraltete llms.txt ist schlimmer als gar keine Datei, weil sie selbstbewusste Anweisungen gibt, die nicht mehr stimmen.

Sollte jede Website eine haben?

Nein.

Eine fünfseitige Broschüren-Website braucht wahrscheinlich keine llms.txt. Ein lokales Restaurant braucht keine, es sei denn, es hat strukturierte Richtlinien oder Buchungsinformationen, die KI-Assistenten häufig falsch wiedergeben.

Nützlicher wird sie, wenn:

  • Ihre Website viel Dokumentation enthält;
  • alte Inhalte mit neuen Inhalten konkurrieren;
  • Sie Forschungs- oder redaktionelles Material veröffentlichen;
  • Lizenzierung und Attribution wichtig sind;
  • KI-Assistenten Ihre Seiten häufig zusammenfassen;
  • interne Teams eine gemeinsame Richtlinie für öffentliche Inhalte benötigen.

Sie ist auch als Teil einer internen Governance-Übung nützlich. Viele Unternehmen haben bereits Mitarbeitende, die Webseiten, Dokumente und Kundenmaterial in KI-Systeme einfügen. Wenn Ihnen das bekannt vorkommt, führen Sie zunächst ein grundlegendes Shadow-AI-Audit durch, bevor Sie annehmen, dass eine öffentliche Textdatei das Risiko behebt.

SEO-Auswirkungen

llms.txt ist in keinem etablierten Sinn ein Rankingfaktor. Schreiben Sie keine, weil Sie nächste Woche einen Traffic-Schub erwarten.

Der indirekte SEO-Fall ist bescheidener:

  • sie erzwingt kanonisches Denken;
  • sie kann KI-vermittelten Such- und Antwortsystemen helfen, Ihre Website zu verstehen;
  • sie verdeutlicht Attributionspräferenzen;
  • sie reduziert Mehrdeutigkeit rund um archivierte Seiten;
  • sie schafft eine öffentliche, überprüfbare Richtlinie zur Inhaltsnutzung durch KI.

Das ist für manche Websites wertvoll. Es ist keine magische Optimierungsebene.

Die beste Version von llms.txt ist klein, aktuell und auf den Rest Ihrer Website abgestimmt. Wenn Ihre Robots-Regeln, Terms page, Sitemap, Canonical Tags und llms.txt alle Unterschiedliches sagen, ist das Problem nicht KI-Crawling. Das Problem ist Governance.

<!-- tool-cta:start -->

💡 Probieren Sie dies aus: Da llms.txt nicht durchsetzbar ist, kombinieren Sie es mit durchsetzbaren Regeln und prüfen Sie diese im Robots.txt Tester, damit Crawler, die Standards befolgen, sich korrekt verhalten.

<!-- tool-cta:end -->

Eine abschließende Empfehlung

Wenn Ihre Website Dokumentation, redaktionelle Inhalte oder Lizenzierungsfragen hat, erstellen Sie eine einfache llms.txt. Halten Sie sie unter einigen Dutzend Zeilen. Nutzen Sie sie, um auf kanonische Ressourcen zu verweisen und Ihre Präferenzen zur Wiederverwendung festzuhalten.

Verwechseln Sie Kommunikation aber nicht mit Kontrolle.

Zum Blockieren nutzen Sie die Ihnen verfügbaren Crawler-Mechanismen und verstehen Sie deren Grenzen. Für Richtlinien veröffentlichen Sie klare Bedingungen. Für Vertrauen seien Sie gegenüber Lesern transparent. llms.txt gehört in diesen Werkzeugkasten als hilfreiches Signal – nicht als Schutzschild.

Häufig gestellte Fragen

Ist llms.txt ein offizieller Standard?
Nein. Es handelt sich um einen aufkommenden Vorschlag und eine Konvention, nicht um einen formalen Webstandard wie das in RFC 9309 beschriebene robots.txt-Protokoll.
Hält llms.txt KI-Unternehmen davon ab, mit meinen Inhalten zu trainieren?
Nicht zuverlässig. Sie können Ihre Präferenz festhalten, aber die Einhaltung hängt vom Crawler oder KI-Unternehmen ab. Nutzen Sie robots.txt, Zugriffskontrollen, Lizenzbedingungen und rechtliche Beratung, wenn stärkere Kontrollen erforderlich sind.
Wo sollte ich llms.txt ablegen?
Legen Sie die Datei im Stammverzeichnis Ihrer Domain ab, etwa unter https://example.com/llms.txt, und stellen Sie sicher, dass sie öffentlich als Plain-Text- oder Markdown-artige Datei zugänglich ist.
Sollte llms.txt jede Seite meiner Website enthalten?
Nein. Sie sollte auf die maßgeblichsten und stabilsten Ressourcen verweisen. Eine kurze, kuratierte Datei ist nützlicher als eine lange, doppelte Sitemap.
Hilft llms.txt bei SEO?
Es gibt keinen etablierten Rankingvorteil. Ihr Wert ist indirekt: klarere kanonische Seiten, besserer KI-gerichteter Kontext und eine öffentliche Richtlinie zur Inhaltsnutzung.

Quellen & weiterführende Literatur

  1. llms.txt proposal
  2. RFC 9309: Robots Exclusion Protocol
  3. Google Search Central: robots.txt introduction and guide
  4. OpenAI: Web crawlers and user agents
Über den Autor
The Wux Webtools Team

Zuletzt aktualisiert:

Weiterlesen