SEO & Discoverability

Come scrivere llms.txt — e se serve davvero a qualcosa

Una guida pratica al file emergente per crawler AI, riepiloghi dei contenuti e istruzioni del sito rivolte ai modelli.

The Wux Webtools Team The Wux Webtools Team 9 minuti di lettura Assistito da IA, revisionato da umani
Abstract illustration of an llms.txt file guiding AI crawler paths through a website structure.
Indice
  1. La versione breve
  2. Che cosa dovrebbe risolvere llms.txt
  3. llms.txt serve davvero a qualcosa?
  4. Non blocca in modo affidabile i crawler AI
  5. Può aiutare l’interpretazione
  6. Può chiarire la tua policy sui contenuti
  7. Che cosa inserire in llms.txt
  8. Che cosa non inserire in llms.txt
  9. Come llms.txt si collega a robots.txt
  10. Un processo di scrittura pratico
  11. 1. Decidi il compito del file
  12. 2. Identifica le pagine canoniche
  13. 3. Scrivi per macchine e persone
  14. 4. Aggiungi il linguaggio di policy con attenzione
  15. 5. Pubblicalo e mantienilo
  16. Ogni sito dovrebbe averne uno?
  17. Implicazioni SEO
  18. Una raccomandazione finale

La versione breve

llms.txt è una convenzione emergente per indicare ai large language models che cos’è il tuo sito, quali pagine contano e come i tuoi contenuti dovrebbero essere interpretati. Di solito si trova in https://example.com/llms.txt, è scritto in Markdown e rimanda a risorse pulite e utili.

Non è la stessa cosa di robots.txt. Non è uno standard web ufficiale. Non blocca in modo affidabile l’addestramento AI. Non obbliga un’azienda AI a rispettare le tue preferenze.

Tuttavia, può valere la pena scriverlo.

Un buon llms.txt è un modo a basso costo per rendere il tuo sito più facile da riassumere correttamente per sistemi AI, agenti, assistenti di ricerca e strumenti interni. È anche una forzatura utile: devi decidere quali contenuti sono canonici, quali sono obsoleti e quali termini si applicano al riutilizzo. Questo è utile anche se, al momento, solo pochi sistemi leggono il file.

Che cosa dovrebbe risolvere llms.txt

La maggior parte dei siti web è costruita per esseri umani e crawler di ricerca. Contiene navigazione, banner dei cookie, schede prodotto, pagine di categoria duplicate, vecchi PDF, parametri di tracciamento e contenuti che hanno senso solo visivamente.

Gli LLM non hanno bisogno dello stesso livello di presentazione. Hanno bisogno di:

  • una descrizione concisa del sito;
  • link alle pagine più autorevoli;
  • contesto in linguaggio semplice su prodotti, documentazione, policy o autorialità;
  • preferenze di licenza e utilizzo;
  • rimandi a versioni strutturate o Markdown, quando disponibili.

La proposta llms.txt riprende un’idea familiare del web: mettere un file di testo prevedibile nella root del dominio. A differenza di robots.txt, che riguarda principalmente i permessi di crawling, llms.txt riguarda soprattutto l’orientamento.

Pensalo come una mappa, non come un cancello.

llms.txt serve davvero a qualcosa?

Oggi, la risposta onesta è: a volte, ma non nel modo in cui molti sperano.

Non blocca in modo affidabile i crawler AI

Se il tuo obiettivo è impedire crawling o addestramento, llms.txt è il meccanismo principale sbagliato. I crawler che rispettano le regole di esclusione sono più propensi a guardare robots.txt, direttive specifiche per user-agent, header HTTP o segnali contrattuali/di licenza. Anche in quel caso, la conformità dipende dall’operatore del crawler.

Il web ha una lunga storia in questo senso. robots.txt stesso è un protocollo volontario, poi formalizzato in RFC 9309. Funziona perché i principali crawler scelgono di rispettarlo, non perché il file abbia un potere magico di applicazione.

llms.txt ha meno adozione e meno standardizzazione di robots.txt. Tratta con sospetto qualsiasi affermazione secondo cui “protegge i tuoi contenuti dall’AI”.

Può aiutare l’interpretazione

Dove llms.txt è più promettente è nell’interpretazione dei contenuti.

Se un assistente AI sta cercando di rispondere a domande sulla tua azienda, documentazione, ricerca, prezzi, API o policy editoriale, un file conciso a livello root può ridurre le supposizioni. Può indirizzare il sistema verso le pagine che mantieni davvero e lontano da frammenti obsoleti.

Questo conta per i siti con grandi archivi. Un modello o un agente può trovare un articolo di supporto del 2019 prima di una pagina di policy del 2026. Il tuo llms.txt può dire, di fatto: “Inizia da qui. Queste sono le risorse autorevoli.”

Non è appariscente, ma è utile.

Può chiarire la tua policy sui contenuti

Una policy pubblica rivolta all’AI è meglio del silenzio, soprattutto per editori, team di documentazione e aziende con materiale sensibile di brand, medico, legale o finanziario.

Questo non significa che dovresti scrivere un muro minaccioso di testo legale. Significa che puoi dichiarare chiaramente:

  • se i sistemi AI possono riassumere le tue pagine pubbliche;
  • se i tuoi contenuti possono essere usati per l’addestramento dei modelli;
  • come vuoi che sia gestita l’attribuzione;
  • quali pagine dovrebbero essere considerate canoniche;
  • chi contattare per licenze o partnership sui dati.

Questo si abbina bene a una più ampia trasparenza editoriale. Se pubblichi contenuti assistiti dall’AI, il tuo llms.txt non dovrebbe contraddire la tua informativa pubblica. Per una base pratica, consulta la nostra guida alla divulgazione AI onesta su un piccolo sito web.

Che cosa inserire in llms.txt

Non esiste uno schema universalmente applicato, ma la convenzione attuale è Markdown. Mantienilo breve, esplicito e noioso.

Una struttura utile ha questo aspetto:

# Example Company

> Example Company publishes practical guides and reference material for independent web developers.

## Canonical resources

- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/

## Content use policy

Public pages may be summarized with attribution to Example Company and a link to the source page.

Use of our content for model training, dataset creation, or bulk republication requires written permission.

## Preferred citation

When citing our content, link to the canonical URL and include the page title.

## Notes for AI systems

- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.

Questo è sufficiente per molti siti.

Per siti più grandi, aggiungi sezioni per aree di prodotto, documentazione API, ricerca, pagine stampa o policy legali. Resisti alla tentazione di elencare tutto. Più il file diventa completo, meno è utile come punto di partenza.

Che cosa non inserire in llms.txt

Non inserirci informazioni private. Sembra ovvio, ma i file di testo a livello root spesso diventano depositi per note operative.

Evita di includere:

  • URL non pubblicati;
  • link interni di staging;
  • chiavi API o token;
  • dettagli di contatto privati;
  • istruzioni di sicurezza;
  • informazioni di prodotto sotto embargo;
  • pagine “segrete” che speri i crawler ignorino.

Se qualcosa non dovrebbe essere pubblico, non menzionarlo in un file pubblico.

Evita anche il teatro legale vago. “Qualsiasi uso AI è vietato per sempre” può esprimere frustrazione, ma non crea un controllo tecnico affidabile. Se la tua organizzazione ha davvero bisogno di restrizioni applicabili, coinvolgi consulenti legali e usa insieme controlli dei crawler, termini di licenza e controlli di accesso.

Come llms.txt si collega a robots.txt

Usa robots.txt per le direttive di crawling. Usa llms.txt per il contesto.

Una divisione semplificata:

| File | Scopo principale | Applicabile? | Ideale per | |---|---|---:|---| | robots.txt | Permessi di crawling | Volontario ma ampiamente riconosciuto | Consentire o negare crawler per percorso e user agent | | llms.txt | Sintesi e indicazioni rivolte agli LLM | Attualmente non standardizzato | Link canonici, policy sui contenuti, note di interpretazione | | Pagina dei termini | Condizioni legali | Dipende dalla giurisdizione e dai fatti | Licenze, riutilizzo consentito, restrizioni commerciali | | Header HTTP | Segnali tecnici a livello pagina | Dipende dal supporto del crawler | Indicizzazione, caching e comportamento della risposta |

Se stai già facendo debug del comportamento dei crawler, non fermarti al file di testo. Verifica se il tuo sito serve davvero il file correttamente, se i redirect si comportano come previsto e se gli header corrispondono alla tua policy. Abbiamo scritto una guida separata al debug di redirect e header HTTP in produzione perché è qui che molte decisioni di “policy” falliscono silenziosamente.

Un processo di scrittura pratico

Ecco un workflow sensato.

1. Decidi il compito del file

Scegli un obiettivo principale:

  • aiutare i sistemi AI a descrivere accuratamente il tuo sito;
  • guidare gli agenti verso la documentazione aggiornata;
  • dichiarare preferenze di riutilizzo e attribuzione;
  • ridurre la confusione su contenuti archiviati o generati dagli utenti.

Se provi a far risolvere a llms.txt ogni problema di governance AI, non ne risolverà nessuno.

2. Identifica le pagine canoniche

Scegli i 5–20 URL che rappresentano meglio il sito. Preferisci pagine stabili e mantenute rispetto alle pagine ad alto traffico. Per un’azienda SaaS, potrebbero essere homepage, documentazione, prezzi, sicurezza, privacy, riferimento API, status e contatti. Per un editore, potrebbero essere hub tematici, standard editoriali, pagine autore, policy sulle correzioni e licenze.

3. Scrivi per macchine e persone

Usa intestazioni Markdown semplici. Evita il testo di marketing. Spiega che cos’è il sito in una o due frasi.

Male:

Stiamo rivoluzionando il futuro dell’eccellenza digitale con soluzioni di nuova generazione.

Meglio:

Acme Docs pubblica documentazione tecnica per l’API dei pagamenti di Acme, inclusi autenticazione, webhooks, SDK e guide alla migrazione.

4. Aggiungi il linguaggio di policy con attenzione

La tua sezione di policy dovrebbe essere comprensibile senza essere troppo sicura di sé. Per esempio:

Le pagine pubbliche possono essere riassunte per ricerca, accessibilità e assistenza agli utenti con attribuzione. Copia in blocco, creazione di dataset o addestramento di modelli richiedono autorizzazione.

Questo non garantisce la conformità, ma è più chiaro del silenzio.

5. Pubblicalo e mantienilo

Posizionalo in /llms.txt. Servilo come text/plain o come risposta testuale compatibile. Linka solo URL canonici. Rivedilo quando cambia la tua architettura dell’informazione.

Un llms.txt obsoleto è peggio di nessun file, perché dà istruzioni sicure che non sono più vere.

Ogni sito dovrebbe averne uno?

No.

Un sito vetrina di cinque pagine probabilmente non ha bisogno di llms.txt. Un ristorante locale non ne ha bisogno, a meno che non abbia policy strutturate o informazioni di prenotazione che gli assistenti AI riportano spesso in modo errato.

Diventa più utile quando:

  • il tuo sito ha molta documentazione;
  • contenuti vecchi competono con contenuti nuovi;
  • pubblichi ricerca o materiale editoriale;
  • licenze e attribuzione sono importanti;
  • gli assistenti AI riassumono spesso le tue pagine;
  • i team interni hanno bisogno di una policy condivisa per i contenuti pubblici.

È utile anche come parte di un esercizio di governance interna. Molte aziende hanno già dipendenti che incollano pagine web, documentazione e materiale dei clienti nei sistemi AI. Se ti suona familiare, esegui un audit di shadow AI di base prima di presumere che un file di testo pubblico risolva il rischio.

Implicazioni SEO

llms.txt non è un fattore di ranking in alcun senso consolidato. Non scriverne uno perché ti aspetti un aumento di traffico la prossima settimana.

Il caso SEO indiretto è più modesto:

  • impone un ragionamento canonico;
  • può aiutare i sistemi di ricerca e risposta mediati dall’AI a comprendere il tuo sito;
  • chiarisce le preferenze di attribuzione;
  • riduce l’ambiguità sulle pagine archiviate;
  • crea una policy pubblica e ispezionabile sull’uso dei contenuti AI.

Per alcuni siti ne vale la pena. Non è un livello magico di ottimizzazione.

La migliore versione di llms.txt è piccola, aggiornata e allineata con il resto del tuo sito. Se le tue regole robots, la pagina dei termini, la sitemap, i tag canonical e llms.txt dicono tutti cose diverse, il problema non è il crawling AI. Il problema è la governance.

<!-- tool-cta:start -->

💡 Prova questo: Poiché llms.txt non è applicabile in modo vincolante, abbinalo a regole applicabili e controllale in Robots.txt Tester affinché i crawler che rispettano gli standard si comportino correttamente.

<!-- tool-cta:end -->

Una raccomandazione finale

Se il tuo sito ha documentazione, contenuti editoriali o preoccupazioni di licenza, crea un semplice llms.txt. Tienilo sotto poche decine di righe. Usalo per indicare risorse canoniche e dichiarare le tue preferenze di riutilizzo.

Ma non confondere la comunicazione con il controllo.

Per bloccare, usa i meccanismi per crawler disponibili e comprendine i limiti. Per la policy, pubblica termini chiari. Per la fiducia, sii trasparente con i lettori. llms.txt appartiene a questo insieme come segnale utile, non come scudo.

Domande frequenti

llms.txt è uno standard ufficiale?
No. È una proposta e convenzione emergente, non uno standard web formale come il protocollo robots.txt descritto in RFC 9309.
llms.txt impedirà alle aziende AI di addestrarsi sui miei contenuti?
Non in modo affidabile. Puoi dichiarare la tua preferenza, ma la conformità dipende dal crawler o dall’azienda AI. Usa robots.txt, controlli di accesso, termini di licenza e consulenza legale quando servono controlli più forti.
Dove dovrei mettere llms.txt?
Mettilo nella root del tuo dominio, per esempio https://example.com/llms.txt, e assicurati che sia accessibile pubblicamente come file di testo semplice o in stile Markdown.
llms.txt dovrebbe includere ogni pagina del mio sito?
No. Dovrebbe indicare le risorse più autorevoli e stabili. Un file breve e curato è più utile di una lunga sitemap duplicata.
llms.txt aiuta la SEO?
Non esiste un beneficio di ranking consolidato. Il suo valore è indiretto: pagine canoniche più chiare, migliore contesto rivolto all’AI e una policy pubblica sull’uso dei contenuti.

Fonti e letture ulteriori

  1. llms.txt proposal
  2. RFC 9309: Robots Exclusion Protocol
  3. Google Search Central: robots.txt introduction and guide
  4. OpenAI: Web crawlers and user agents
Informazioni sull'autore
The Wux Webtools Team

Ultimo aggiornamento:

Continua a leggere