llms.txtの書き方——そして実際に何か役に立つのか
AIクローラー、コンテンツ要約、モデル向けサイト指示のために登場しつつあるファイルの実践ガイド。
目次
要点
llms.txtは、大規模言語モデルに対して、あなたのサイトが何であり、どのページが重要で、コンテンツをどう理解すべきかを伝えるための新しい慣習です。通常はhttps://example.com/llms.txtに置かれ、Markdownで書かれ、整理された有用なリソースへリンクします。
これはrobots.txtと同じものではありません。公式なWeb標準でもありません。AI学習を確実にブロックするものでもありません。AI企業にあなたの希望に従うことを強制するものでもありません。
それでも、書く価値はあります。
良いllms.txtは、AIシステム、エージェント、検索アシスタント、社内ツールがあなたのサイトを正しく要約しやすくする、低コストな方法です。また、これは意思決定を促す仕組みでもあります。どのコンテンツが正規で、どのコンテンツが古く、再利用にどの条件が適用されるのかを決める必要があるからです。現在そのファイルを読むシステムが少数だとしても、それ自体に価値があります。
llms.txtが解決しようとしていること
ほとんどのWebサイトは、人間と検索クローラー向けに作られています。ナビゲーション、Cookieバナー、商品カード、重複したカテゴリページ、古いPDF、トラッキングパラメータ、視覚的に見て初めて意味が分かるコンテンツが含まれています。
LLMには同じ表示レイヤーは必要ありません。必要なのは次のようなものです。
- サイトの簡潔な説明;
- 最も信頼できるページへのリンク;
- 製品、ドキュメント、ポリシー、著者性に関する平易な文脈;
- ライセンスと利用に関する希望;
- 利用可能な場合は構造化版またはMarkdown版への案内。
llms.txtの提案は、なじみのあるWebの考え方を借りています。ドメインのルートに予測可能なテキストファイルを置く、というものです。主にクロール許可に関するrobots.txtとは異なり、llms.txtは主に方向づけのためのものです。
ゲートではなく、地図だと考えてください。
llms.txtは実際に何か役に立つのか?
現時点での正直な答えは、場合による、ただし多くの人が期待する形ではない、です。
AIクローラーを確実にブロックするものではない
目的がクロールや学習の防止であるなら、llms.txtは主要な手段としては不適切です。除外ルールを尊重するクローラーは、robots.txt、特定のuser-agentディレクティブ、HTTPヘッダー、契約上またはライセンス上のシグナルを見る可能性の方が高いでしょう。それでも、遵守するかどうかはクローラー運営者次第です。
Webにはこの点で長い歴史があります。robots.txt自体も任意のプロトコルであり、後にRFC 9309で形式化されました。機能しているのは、主要なクローラーがそれを尊重することを選んでいるからであって、そのファイルに魔法のような強制力があるからではありません。
llms.txtはrobots.txtよりも採用も標準化も進んでいません。「あなたのコンテンツをAIから保護する」といった主張は疑ってかかるべきです。
解釈には役立つ可能性がある
llms.txtがより有望なのは、コンテンツの解釈です。
AIアシスタントがあなたの会社、ドキュメント、研究、価格、API、編集方針について回答しようとしている場合、ルートレベルにある簡潔なファイルは推測を減らせます。実際にメンテナンスしているページへシステムを導き、古くなった断片から遠ざけることができます。
これは大きなアーカイブを持つサイトでは重要です。モデルやエージェントは、2026年のポリシーページより先に2019年のサポート記事を見つけるかもしれません。あなたのllms.txtは、実質的にこう伝えられます。「ここから始めてください。これらが信頼できるリソースです。」
派手ではありませんが、有用です。
コンテンツポリシーを明確にできる
公開されたAI向けポリシーは、沈黙よりも優れています。特に、出版社、ドキュメントチーム、ブランド面または医療・法務・金融面で慎重さが必要な素材を扱う企業にとってそうです。
これは、脅しのような法律文を長々と書くべきだという意味ではありません。次のようなことを、平易に示せるという意味です。
- AIシステムが公開ページを要約してよいか;
- コンテンツをモデル学習に使用してよいか;
- 出典表示をどのように扱ってほしいか;
- どのページを正規と見なすべきか;
- ライセンスやデータ提携について誰に連絡すべきか。
これは、より広い編集上の透明性とも相性が良いものです。AI支援コンテンツを公開している場合、llms.txtは公開している開示内容と矛盾してはいけません。実践的な基準として、小規模Webサイトにおける誠実なAI開示とは何かのガイドも参照してください。
llms.txtに何を書くべきか
普遍的に強制されるスキーマはありませんが、現在の慣習はMarkdownです。短く、明確に、退屈なくらいにしておきます。
有用な構成は次のようなものです。
# Example Company
> Example Company publishes practical guides and reference material for independent web developers.
## Canonical resources
- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/
## Content use policy
Public pages may be summarized with attribution to Example Company and a link to the source page.
Use of our content for model training, dataset creation, or bulk republication requires written permission.
## Preferred citation
When citing our content, link to the canonical URL and include the page title.
## Notes for AI systems
- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.
多くのサイトではこれで十分です。
より大きなサイトでは、製品領域、APIドキュメント、研究、プレスページ、法的ポリシーのセクションを追加します。すべてを列挙したい衝動は抑えてください。ファイルが網羅的になるほど、出発点としての有用性は下がります。
llms.txtに書くべきでないこと
非公開情報を書いてはいけません。これは当然に聞こえますが、ルートレベルのテキストファイルはしばしば運用メモの置き場になりがちです。
含めるのを避けるべきものは次の通りです。
- 未公開URL;
- 内部ステージングリンク;
- APIキーまたはトークン;
- 非公開の連絡先情報;
- セキュリティ手順;
- 解禁前の製品情報;
- クローラーに無視してほしい「秘密」のページ。
公開すべきでないものは、公開ファイルで言及しないでください。
また、曖昧な法律的演出も避けてください。「すべてのAI利用を永遠に禁止する」は不満を表明するかもしれませんが、信頼できる技術的制御にはなりません。組織として本当に強制力のある制限が必要なら、法務の助言を得たうえで、クローラー制御、ライセンス条件、アクセス制御を組み合わせて使用してください。
llms.txtとrobots.txtの関係
クロール指示にはrobots.txtを使います。文脈にはllms.txtを使います。
単純化すると次のように分けられます。
| File | Main purpose | Enforceable? | Best used for | |---|---|---:|---| | robots.txt | クロール許可 | 任意だが広く認識されている | パスとuser agentごとにクローラーを許可または不許可にすること | | llms.txt | LLM向けの要約とガイダンス | 現時点では標準化されていない | 正規リンク、コンテンツポリシー、解釈上の注記 | | Terms page | 法的条件 | 管轄と事実関係による | ライセンス、許可された再利用、商用上の制限 | | HTTP headers | ページ単位の技術的シグナル | クローラーの対応状況による | インデックス、キャッシュ、レスポンス動作 |
すでにクローラーの挙動をデバッグしているなら、テキストファイルだけで止めないでください。サイトが実際にファイルを正しく配信しているか、リダイレクトが期待通りに動作しているか、ヘッダーがポリシーと一致しているかを確認してください。多くの「ポリシー」判断が静かに失敗するのはこの場所なので、私たちは本番環境でリダイレクトとHTTPヘッダーをデバッグするための小さなツールキットについて別ガイドを書きました。
実践的な執筆プロセス
妥当なワークフローは次の通りです。
1. ファイルの役割を決める
主な目的を1つ選びます。
- AIシステムがサイトを正確に説明できるようにする;
- エージェントを最新のドキュメントへ導く;
- 再利用と出典表示に関する希望を示す;
- アーカイブ済みコンテンツやユーザー生成コンテンツをめぐる混乱を減らす。
llms.txtにAIガバナンス上のあらゆる問題を解決させようとすると、どれも解決できません。
2. 正規ページを特定する
サイトを最もよく表す5〜20個のURLを選びます。高トラフィックのページよりも、安定してメンテナンスされているページを優先します。SaaS企業なら、ホームページ、ドキュメント、価格、セキュリティ、プライバシー、APIリファレンス、ステータス、連絡先などが考えられます。出版社なら、トピックハブ、編集基準、著者ページ、訂正ポリシー、ライセンスなどが考えられます。
3. 機械と人間の両方に向けて書く
平易なMarkdown見出しを使います。マーケティング文句は避けます。サイトが何であるかを1、2文で述べます。
悪い例:
We are revolutionizing the future of digital excellence with next-generation solutions.
より良い例:
Acme Docs publishes technical documentation for Acme’s payments API, including authentication, webhooks, SDKs, and migration guides.
4. ポリシー文言は慎重に追加する
ポリシーのセクションは、過度に断定的にならずに理解できるものであるべきです。たとえば次のように書けます。
Public pages may be summarized for search, accessibility, and user assistance with attribution. Bulk copying, dataset creation, or model training requires permission.
これで遵守が保証されるわけではありませんが、沈黙よりは明確です。
5. 公開し、保守する
/llms.txtに置きます。text/plainまたは互換性のあるテキストレスポンスとして配信します。正規URLのみにリンクします。情報アーキテクチャが変わったときに見直します。
古くなったllms.txtは、ファイルがないより悪い場合があります。もはや正しくない指示を、自信ありげに与えてしまうからです。
すべてのサイトが用意すべきか?
いいえ。
5ページ程度のパンフレットサイトには、おそらくllms.txtは不要です。地域のレストランにも、AIアシスタントが頻繁に誤って伝える構造化ポリシーや予約情報がない限り、必要ありません。
より有用になるのは次のような場合です。
- サイトに大量のドキュメントがある;
- 古いコンテンツが新しいコンテンツと競合している;
- 研究または編集コンテンツを公開している;
- ライセンスと出典表示が重要である;
- AIアシスタントがあなたのページを頻繁に要約する;
- 社内チームが公開コンテンツに関する共通ポリシーを必要としている。
社内ガバナンスの取り組みの一部としても有用です。多くの企業ではすでに、従業員がWebページ、ドキュメント、顧客資料をAIシステムに貼り付けています。心当たりがあるなら、公開テキストファイルがリスクを解決すると考える前に、基本的なシャドーAI監査を実施してください。
SEOへの影響
llms.txtは、確立された意味でのランキング要因ではありません。来週トラフィックが増えることを期待して書くものではありません。
間接的なSEO上の意味は、もっと控えめです。
- 正規ページについて考えることを促す;
- AIを介した検索や回答システムがサイトを理解する助けになる可能性がある;
- 出典表示に関する希望を明確にする;
- アーカイブ済みページをめぐる曖昧さを減らす;
- 公開され、検査可能なAIコンテンツ利用ポリシーを作る。
一部のサイトにとっては価値があります。ただし、魔法の最適化レイヤーではありません。
最良のllms.txtは、小さく、最新で、サイト全体と整合しています。robotsルール、利用規約ページ、sitemap、canonicalタグ、llms.txtがそれぞれ違うことを言っているなら、問題はAIクロールではありません。問題はガバナンスです。
<!-- tool-cta:start -->
💡 お試しください: llms.txt は強制力を持たないため、強制可能なルールと組み合わせ、Robots.txt Tester でそれらを確認して、標準に従うクローラーが正しく動作するようにしましょう。
<!-- tool-cta:end -->
最後の推奨事項
サイトにドキュメント、編集コンテンツ、ライセンス上の懸念があるなら、シンプルなllms.txtを作成してください。数十行以内に抑えます。正規リソースを示し、再利用に関する希望を述べるために使います。
ただし、コミュニケーションをコントロールと混同しないでください。
ブロックには、利用可能なクローラー向けの仕組みを使い、その限界を理解してください。ポリシーには、明確な条件を公開してください。信頼のためには、読者に対して透明でいてください。llms.txtはその一連の仕組みの中で役立つシグナルであり、盾ではありません。