llms.txt কীভাবে লিখবেন—এবং এটি সত্যিই কিছু করে কি না
AI crawler, content summary, এবং model-facing site instructions-এর জন্য উদীয়মান ফাইল নিয়ে একটি ব্যবহারিক গাইড।
সুচিপত্র
- সংক্ষিপ্ত সংস্করণ
- llms.txt কোন সমস্যা সমাধানের জন্য
- llms.txt আসলে কিছু করে কি?
- এটি নির্ভরযোগ্যভাবে AI crawler block করে না
- এটি interpretation-এ সাহায্য করতে পারে
- এটি আপনার content policy পরিষ্কার করতে পারে
- llms.txt-এ কী রাখবেন
- llms.txt-এ কী রাখবেন না
- llms.txt কীভাবে robots.txt-এর সঙ্গে সম্পর্কিত
- একটি ব্যবহারিক লেখার প্রক্রিয়া
- 1. fileটির কাজ ঠিক করুন
- 2. canonical page চিহ্নিত করুন
- 3. machine এবং human—দুইয়ের জন্য লিখুন
- 4. policy language সাবধানে যোগ করুন
- 5. publish করুন এবং maintain করুন
- প্রতিটি site-এর কি এটি থাকা উচিত?
- SEO implications
- শেষ সুপারিশ
সংক্ষিপ্ত সংস্করণ
llms.txt হলো একটি উদীয়মান convention, যার মাধ্যমে large language model-কে জানানো যায় আপনার site কী, কোন page গুরুত্বপূর্ণ, এবং আপনার content কীভাবে বোঝা উচিত। এটি সাধারণত https://example.com/llms.txt-এ থাকে, Markdown-এ লেখা হয়, এবং পরিষ্কার, উপযোগী resource-এ link করে।
এটি robots.txt-এর মতো নয়। এটি কোনো official web standard নয়। এটি নির্ভরযোগ্যভাবে AI training block করে না। এটি কোনো AI company-কে আপনার ইচ্ছা মানতে বাধ্য করে না।
তবু, এটি লেখা মূল্যবান হতে পারে।
একটি ভালো llms.txt কম খরচে আপনার site-কে AI system, agent, search assistant, এবং internal tool-এর জন্য সঠিকভাবে summarize করা সহজ করে। এটি একটি forcing function-ও: আপনাকে ঠিক করতে হয় কোন content canonical, কোন content stale, এবং reuse-এর জন্য কোন terms প্রযোজ্য। বর্তমানে মাত্র কয়েকটি system ফাইলটি পড়লেও এটি উপযোগী।
llms.txt কোন সমস্যা সমাধানের জন্য
বেশিরভাগ website মানুষ এবং search crawler-এর জন্য তৈরি। সেগুলোতে navigation, cookie banner, product card, duplicate category page, পুরোনো PDF, tracking parameter, এবং এমন content থাকে যা শুধু দৃশ্যগতভাবে অর্থবহ।
LLM-এর একই presentation layer দরকার হয় না। তাদের দরকার:
- site-এর সংক্ষিপ্ত বিবরণ;
- সবচেয়ে authoritative page-গুলোর link;
- product, docs, policy, বা authorship সম্পর্কে সহজ ভাষার context;
- licensing এবং usage preference;
- যেখানে পাওয়া যায় সেখানে structured বা Markdown version-এর pointer।
llms.txt প্রস্তাবটি web-এর একটি পরিচিত ধারণা ধার করে: domain-এর root-এ একটি predictable text file রাখুন। robots.txt যেখানে মূলত crawl permission নিয়ে, llms.txt সেখানে বেশিরভাগই orientation নিয়ে।
এটিকে gate নয়, map হিসেবে ভাবুন।
llms.txt আসলে কিছু করে কি?
আজকের সৎ উত্তর হলো: কখনও কখনও করে, কিন্তু অনেকের প্রত্যাশিতভাবে নয়।
এটি নির্ভরযোগ্যভাবে AI crawler block করে না
আপনার লক্ষ্য যদি crawling বা training ঠেকানো হয়, তাহলে llms.txt ভুল primary mechanism। exclusion rule মানে এমন crawler বেশি সম্ভবত robots.txt, নির্দিষ্ট user-agent directive, HTTP header, বা contractual/licensing signal দেখবে। তারপরও compliance নির্ভর করে crawler operator-এর ওপর।
এ ক্ষেত্রে web-এর দীর্ঘ ইতিহাস আছে। robots.txt নিজেই একটি voluntary protocol, যা পরে RFC 9309-এ formalized হয়েছে। এটি কাজ করে কারণ প্রধান crawler-রা এটি মানতে বেছে নেয়, fileটির কোনো magical enforcement power আছে বলে নয়।
llms.txt-এর adoption এবং standardization robots.txt-এর চেয়ে কম। “এটি আপনার content-কে AI থেকে protect করে”—এমন যেকোনো দাবি সন্দেহের চোখে দেখুন।
এটি interpretation-এ সাহায্য করতে পারে
llms.txt যেখানে বেশি promising, সেটি হলো content interpretation।
যদি কোনো AI assistant আপনার company, documentation, research, pricing, API, বা editorial policy নিয়ে প্রশ্নের উত্তর দিতে চেষ্টা করে, একটি concise root-level file guesswork কমাতে পারে। এটি system-কে আপনার বাস্তবে maintained page-গুলোর দিকে নির্দেশ করতে পারে এবং outdated fragment থেকে দূরে রাখতে পারে।
বড় archive আছে এমন site-এর জন্য এটি গুরুত্বপূর্ণ। কোনো model বা agent 2026 policy page-এর আগে 2019 সালের support article খুঁজে পেতে পারে। আপনার llms.txt কার্যত বলতে পারে: “এখান থেকে শুরু করুন। এগুলোই authoritative resource।”
এটি glamorous নয়, কিন্তু useful।
এটি আপনার content policy পরিষ্কার করতে পারে
একটি public AI-facing policy নীরবতার চেয়ে ভালো, বিশেষ করে publisher, documentation team, এবং sensitive brand বা medical/legal/financial material আছে এমন company-র জন্য।
এর মানে এই নয় যে আপনাকে legal text-এর হুমকিমূলক wall লিখতে হবে। এর মানে হলো আপনি সরাসরি বলতে পারেন:
- AI system আপনার public page summarize করতে পারবে কি না;
- আপনার content model training-এর জন্য ব্যবহার করা যাবে কি না;
- attribution কীভাবে handle করতে চান;
- কোন page canonical হিসেবে বিবেচিত হওয়া উচিত;
- licensing বা data partnership-এর জন্য কার সঙ্গে contact করতে হবে।
এটি broader editorial transparency-এর সঙ্গে ভালোভাবে মেলে। আপনি যদি AI-assisted content publish করেন, আপনার llms.txt যেন আপনার public disclosure-এর সঙ্গে contradict না করে। practical baseline-এর জন্য আমাদের ছোট website-এ honest AI disclosure কেমন হওয়া উচিত গাইডটি দেখুন।
llms.txt-এ কী রাখবেন
সর্বজনীনভাবে enforced কোনো schema নেই, কিন্তু বর্তমান convention হলো Markdown। এটি short, explicit, এবং boring রাখুন।
একটি useful structure দেখতে এমন:
# Example Company
> Example Company publishes practical guides and reference material for independent web developers.
## Canonical resources
- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/
## Content use policy
Public pages may be summarized with attribution to Example Company and a link to the source page.
Use of our content for model training, dataset creation, or bulk republication requires written permission.
## Preferred citation
When citing our content, link to the canonical URL and include the page title.
## Notes for AI systems
- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.
অনেক site-এর জন্য এটিই যথেষ্ট।
বড় site-এর জন্য product area, API docs, research, press page, বা legal policy-এর section যোগ করুন। সবকিছু list করার তাড়না সংবরণ করুন। file যত বেশি comprehensive হয়, starting point হিসেবে এটি তত কম useful হয়।
llms.txt-এ কী রাখবেন না
এতে private information রাখবেন না। এটি obvious শোনালেও, root-level text file প্রায়ই operational note-এর dumping ground হয়ে যায়।
নিচের বিষয়গুলো include করা এড়িয়ে চলুন:
- unpublished URL;
- internal staging link;
- API key বা token;
- private contact detail;
- security instruction;
- embargoed product information;
- “secret” page, যা crawler উপেক্ষা করবে বলে আপনি আশা করছেন।
কোনো কিছু public হওয়া উচিত না হলে, public file-এ সেটির উল্লেখ করবেন না।
Vague legal theater-ও এড়িয়ে চলুন। “All AI use is forbidden forever” হতাশা প্রকাশ করতে পারে, কিন্তু এটি নির্ভরযোগ্য technical control তৈরি করে না। আপনার organization-এর সত্যিই enforceable restriction দরকার হলে, legal counsel যুক্ত করুন এবং crawler control, licensing term, ও access control একসঙ্গে ব্যবহার করুন।
llms.txt কীভাবে robots.txt-এর সঙ্গে সম্পর্কিত
Crawl directive-এর জন্য robots.txt ব্যবহার করুন। Context-এর জন্য llms.txt ব্যবহার করুন।
একটি simplified split:
| File | Main purpose | Enforceable? | Best used for | |---|---|---:|---| | robots.txt | Crawl permission | Voluntary, কিন্তু widely recognized | path এবং user agent অনুযায়ী crawler allow বা disallow করা | | llms.txt | LLM-facing summary এবং guidance | বর্তমানে standardized নয় | Canonical link, content policy, interpretation note | | Terms page | Legal condition | jurisdiction এবং fact-এর ওপর নির্ভর করে | Licensing, permitted reuse, commercial restriction | | HTTP headers | Page-level technical signal | crawler support-এর ওপর নির্ভর করে | Indexing, caching, এবং response behavior |
আপনি যদি ইতিমধ্যে crawler behavior debug করেন, text file-এ থেমে যাবেন না। আপনার site সত্যিই fileটি সঠিকভাবে serve করে কি না, redirect প্রত্যাশামতো আচরণ করে কি না, এবং header আপনার policy-এর সঙ্গে মেলে কি না—এসব পরীক্ষা করুন। আমরা production-এ redirect এবং HTTP header debug করার ছোট toolkit নিয়ে আলাদা guide লিখেছি, কারণ অনেক “policy” decision নীরবে এখানেই fail করে।
একটি ব্যবহারিক লেখার প্রক্রিয়া
এখানে একটি sensible workflow দেওয়া হলো।
1. fileটির কাজ ঠিক করুন
একটি primary goal বেছে নিন:
- AI system-কে আপনার site সঠিকভাবে describe করতে সাহায্য করা;
- agent-কে current documentation-এর দিকে guide করা;
- reuse এবং attribution preference জানানো;
- archived বা user-generated content নিয়ে confusion কমানো।
আপনি যদি llms.txt দিয়ে প্রতিটি AI governance problem সমাধান করতে চান, এটি কোনো সমস্যাই সমাধান করবে না।
2. canonical page চিহ্নিত করুন
site-কে সবচেয়ে ভালোভাবে represent করে এমন 5–20টি URL বেছে নিন। high-traffic page-এর চেয়ে stable, maintained page-কে preference দিন। একটি SaaS company-র জন্য তা হতে পারে homepage, docs, pricing, security, privacy, API reference, status, এবং contact। publisher-এর জন্য হতে পারে topic hub, editorial standard, author page, correction policy, এবং licensing।
3. machine এবং human—দুইয়ের জন্য লিখুন
Plain Markdown heading ব্যবহার করুন। Marketing copy এড়িয়ে চলুন। site কী, তা এক বা দুই sentence-এ বলুন।
খারাপ:
We are revolutionizing the future of digital excellence with next-generation solutions.
ভালো:
Acme Docs publishes technical documentation for Acme’s payments API, including authentication, webhooks, SDKs, and migration guides.
4. policy language সাবধানে যোগ করুন
আপনার policy section overconfident না হয়েও understandable হওয়া উচিত। যেমন:
Public pages may be summarized for search, accessibility, and user assistance with attribution. Bulk copying, dataset creation, or model training requires permission.
এটি compliance guarantee করে না, কিন্তু silence-এর চেয়ে পরিষ্কার।
5. publish করুন এবং maintain করুন
এটি /llms.txt-এ রাখুন। text/plain বা compatible text response হিসেবে serve করুন। শুধু canonical URL-এ link করুন। আপনার information architecture বদলালে এটি review করুন।
Stale llms.txt না থাকার চেয়েও খারাপ, কারণ এটি আত্মবিশ্বাসী instruction দেয় যা আর সত্য নয়।
প্রতিটি site-এর কি এটি থাকা উচিত?
না।
পাঁচ-page-এর brochure site-এর সম্ভবত llms.txt দরকার নেই। local restaurant-এরও দরকার নেই, যদি না তার structured policy বা booking information থাকে যা AI assistant প্রায়ই ভুলভাবে বলে।
এটি বেশি useful হয় যখন:
- আপনার site-এ প্রচুর documentation আছে;
- পুরোনো content নতুন content-এর সঙ্গে compete করে;
- আপনি research বা editorial material publish করেন;
- licensing এবং attribution গুরুত্বপূর্ণ;
- AI assistant প্রায়ই আপনার page summarize করে;
- public content-এর জন্য internal team-এর shared policy দরকার।
Internal governance exercise-এর অংশ হিসেবেও এটি useful। অনেক company-তেই employee ইতিমধ্যে web page, docs, এবং customer material AI system-এ paste করছে। এটি পরিচিত মনে হলে, public text file risk ঠিক করে দেবে ধরে নেওয়ার আগে একটি basic shadow AI audit চালান।
SEO implications
llms.txt কোনো established অর্থে ranking factor নয়। আগামী সপ্তাহে traffic boost আশা করে এটি লিখবেন না।
Indirect SEO case আরও modest:
- এটি canonical thinking বাধ্য করে;
- এটি AI-mediated search এবং answer system-কে আপনার site বুঝতে সাহায্য করতে পারে;
- এটি attribution preference পরিষ্কার করে;
- এটি archived page নিয়ে ambiguity কমায়;
- এটি একটি public, inspectable AI content policy তৈরি করে।
কিছু site-এর জন্য এটি worthwhile। এটি কোনো magic optimization layer নয়।
llms.txt-এর সেরা version ছোট, current, এবং আপনার site-এর বাকি অংশের সঙ্গে aligned। আপনার robots rule, terms page, sitemap, canonical tag, এবং llms.txt যদি সব আলাদা কথা বলে, সমস্যা AI crawling নয়। সমস্যা governance।
<!-- tool-cta:start -->
💡 এটি চেষ্টা করুন: যেহেতু llms.txt প্রয়োগযোগ্য নয়, এটিকে প্রয়োগযোগ্য নিয়মের সঙ্গে যুক্ত করুন এবং সেগুলি Robots.txt Tester-এ পরীক্ষা করুন, যাতে মানদণ্ড মেনে চলা ক্রলারগুলি সঠিকভাবে আচরণ করে।
<!-- tool-cta:end -->
শেষ সুপারিশ
আপনার site-এ documentation, editorial content, বা licensing concern থাকলে একটি simple llms.txt তৈরি করুন। এটি কয়েক dozen line-এর মধ্যে রাখুন। canonical resource-এ point করতে এবং reuse preference জানাতে এটি ব্যবহার করুন।
কিন্তু communication-কে control ভেবে ভুল করবেন না।
Blocking-এর জন্য আপনার কাছে থাকা crawler mechanism ব্যবহার করুন এবং তাদের limit বুঝুন। Policy-এর জন্য clear terms publish করুন। Trust-এর জন্য reader-এর সঙ্গে transparent থাকুন। llms.txt সেই stack-এ একটি helpful signal হিসেবে থাকে—shield হিসেবে নয়।