Cómo escribir llms.txt —y si realmente sirve de algo
Una guía práctica sobre el archivo emergente para rastreadores de IA, resúmenes de contenido e instrucciones del sitio orientadas a modelos.
Tabla de contenido
- La versión corta
- Qué pretende resolver llms.txt
- ¿llms.txt sirve realmente de algo?
- No bloquea de forma fiable los rastreadores de IA
- Puede ayudar con la interpretación
- Puede aclarar tu política de contenido
- Qué incluir en llms.txt
- Qué no incluir en llms.txt
- Cómo se relaciona llms.txt con robots.txt
- Un proceso práctico de escritura
- 1. Decide la función del archivo
- 2. Identifica las páginas canónicas
- 3. Escribe para máquinas y humanos
- 4. Añade lenguaje de política con cuidado
- 5. Publícalo y mantenlo
- ¿Todos los sitios deberían tener uno?
- Implicaciones para SEO
- Una recomendación final
La versión corta
llms.txt es una convención emergente para indicar a los grandes modelos de lenguaje qué es tu sitio, qué páginas importan y cómo debe entenderse tu contenido. Por lo general se encuentra en https://example.com/llms.txt, está escrito en Markdown y enlaza a recursos limpios y útiles.
No es lo mismo que robots.txt. No es un estándar web oficial. No bloquea de forma fiable el entrenamiento de IA. No obliga a una empresa de IA a respetar tus preferencias.
Aun así, puede valer la pena escribirlo.
Un buen llms.txt es una forma de bajo coste de facilitar que los sistemas de IA, agentes, asistentes de búsqueda y herramientas internas resuman correctamente tu sitio. También funciona como una obligación útil: tienes que decidir qué contenido es canónico, qué contenido está obsoleto y qué condiciones se aplican a la reutilización. Eso resulta útil incluso si, por ahora, solo unos pocos sistemas leen el archivo.
Qué pretende resolver llms.txt
La mayoría de los sitios web están construidos para humanos y rastreadores de búsqueda. Contienen navegación, banners de cookies, tarjetas de producto, páginas de categoría duplicadas, PDFs antiguos, parámetros de seguimiento y contenido que solo tiene sentido visualmente.
Los LLMs no necesitan la misma capa de presentación. Necesitan:
- una descripción concisa del sitio;
- enlaces a las páginas más autorizadas;
- contexto en lenguaje claro sobre productos, documentación, políticas o autoría;
- preferencias de licencia y uso;
- referencias a versiones estructuradas o en Markdown cuando estén disponibles.
La propuesta de llms.txt toma prestada una idea web familiar: colocar un archivo de texto predecible en la raíz del dominio. A diferencia de robots.txt, que trata principalmente sobre permisos de rastreo, llms.txt trata sobre todo de orientación.
Piensa en él como un mapa, no como una puerta.
¿llms.txt sirve realmente de algo?
Hoy, la respuesta honesta es: a veces, pero no de la forma que muchas personas esperan.
No bloquea de forma fiable los rastreadores de IA
Si tu objetivo es impedir el rastreo o el entrenamiento, llms.txt no es el mecanismo principal adecuado. Los rastreadores que respetan reglas de exclusión tienen más probabilidades de consultar robots.txt, directivas específicas por user-agent, encabezados HTTP o señales contractuales/de licencia. Incluso entonces, el cumplimiento depende del operador del rastreador.
La web tiene una larga historia en este punto. El propio robots.txt es un protocolo voluntario, formalizado más tarde en RFC 9309. Funciona porque los principales rastreadores deciden respetarlo, no porque el archivo tenga un poder mágico de aplicación.
llms.txt tiene menos adopción y menos estandarización que robots.txt. Trata con escepticismo cualquier afirmación de que “protege tu contenido de la IA”.
Puede ayudar con la interpretación
Donde llms.txt resulta más prometedor es en la interpretación del contenido.
Si un asistente de IA intenta responder preguntas sobre tu empresa, documentación, investigación, precios, API o política editorial, un archivo conciso en la raíz puede reducir las conjeturas. Puede dirigir el sistema hacia las páginas que realmente mantienes y alejarlo de fragmentos desactualizados.
Esto importa para sitios con archivos extensos. Un modelo o agente puede encontrar un artículo de soporte de 2019 antes que una página de políticas de 2026. Tu llms.txt puede decir, en la práctica: “Empieza aquí. Estos son los recursos autorizados”.
No es glamuroso, pero es útil.
Puede aclarar tu política de contenido
Una política pública orientada a la IA es mejor que el silencio, especialmente para editores, equipos de documentación y empresas con material sensible de marca o de carácter médico/legal/financiero.
Esto no significa que debas escribir un muro amenazante de texto legal. Significa que puedes indicar, de forma clara:
- si los sistemas de IA pueden resumir tus páginas públicas;
- si tu contenido puede utilizarse para entrenamiento de modelos;
- cómo quieres que se gestione la atribución;
- qué páginas deben considerarse canónicas;
- con quién contactar para licencias o alianzas de datos.
Esto encaja bien con una transparencia editorial más amplia. Si publicas contenido asistido por IA, tu llms.txt no debería contradecir tu declaración pública. Como base práctica, consulta nuestra guía sobre divulgación honesta de IA en un sitio web pequeño.
Qué incluir en llms.txt
No existe un esquema aplicado universalmente, pero la convención actual es Markdown. Mantenlo breve, explícito y aburrido.
Una estructura útil se ve así:
# Example Company
> Example Company publishes practical guides and reference material for independent web developers.
## Canonical resources
- Homepage: https://example.com/
- Documentation: https://example.com/docs/
- Pricing: https://example.com/pricing/
- Editorial policy: https://example.com/editorial-policy/
- Contact: https://example.com/contact/
## Content use policy
Public pages may be summarized with attribution to Example Company and a link to the source page.
Use of our content for model training, dataset creation, or bulk republication requires written permission.
## Preferred citation
When citing our content, link to the canonical URL and include the page title.
## Notes for AI systems
- Prefer current documentation under /docs/ over archived blog posts.
- Do not treat user comments as official guidance.
- Product screenshots may be outdated; use written documentation as the source of truth.
Eso basta para muchos sitios.
En sitios más grandes, añade secciones para áreas de producto, documentación de API, investigación, páginas de prensa o políticas legales. Resiste la tentación de listarlo todo. Cuanto más exhaustivo se vuelva el archivo, menos útil será como punto de partida.
Qué no incluir en llms.txt
No incluyas información privada. Suena obvio, pero los archivos de texto en la raíz suelen convertirse en vertederos de notas operativas.
Evita incluir:
- URLs no publicadas;
- enlaces internos de staging;
- claves de API o tokens;
- datos de contacto privados;
- instrucciones de seguridad;
- información de producto bajo embargo;
- páginas “secretas” que esperas que los rastreadores ignoren.
Si algo no debe ser público, no lo menciones en un archivo público.
Evita también el teatro legal impreciso. “Todo uso de IA queda prohibido para siempre” puede expresar frustración, pero no crea un control técnico fiable. Si tu organización realmente necesita restricciones exigibles, implica a asesoría legal y combina controles de rastreadores, términos de licencia y controles de acceso.
Cómo se relaciona llms.txt con robots.txt
Usa robots.txt para directivas de rastreo. Usa llms.txt para contexto.
Una división simplificada:
| Archivo | Propósito principal | ¿Exigible? | Mejor uso | |---|---|---:|---| | robots.txt | Permisos de rastreo | Voluntario, pero ampliamente reconocido | Permitir o denegar rastreadores por ruta y user agent | | llms.txt | Resumen y guía orientados a LLM | No estandarizado actualmente | Enlaces canónicos, política de contenido, notas de interpretación | | Página de términos | Condiciones legales | Depende de la jurisdicción y de los hechos | Licencias, reutilización permitida, restricciones comerciales | | Encabezados HTTP | Señales técnicas a nivel de página | Depende del soporte del rastreador | Indexación, almacenamiento en caché y comportamiento de respuesta |
Si ya estás depurando el comportamiento de rastreadores, no te detengas en el archivo de texto. Comprueba si tu sitio realmente sirve el archivo correctamente, si las redirecciones se comportan como esperas y si los encabezados coinciden con tu política. Escribimos una guía aparte sobre depuración de redirecciones y encabezados HTTP en producción porque ahí es donde muchas decisiones de “política” fallan en silencio.
Un proceso práctico de escritura
Este es un flujo de trabajo sensato.
1. Decide la función del archivo
Elige un objetivo principal:
- ayudar a los sistemas de IA a describir tu sitio con precisión;
- guiar a los agentes hacia la documentación actual;
- indicar preferencias de reutilización y atribución;
- reducir la confusión en torno a contenido archivado o generado por usuarios.
Si intentas que llms.txt resuelva todos los problemas de gobernanza de IA, no resolverá ninguno.
2. Identifica las páginas canónicas
Elige las 5–20 URLs que mejor representen el sitio. Prioriza páginas estables y mantenidas frente a páginas con mucho tráfico. Para una empresa SaaS, podrían ser la página de inicio, documentación, precios, seguridad, privacidad, referencia de API, estado y contacto. Para un editor, podrían ser centros temáticos, normas editoriales, páginas de autores, política de correcciones y licencias.
3. Escribe para máquinas y humanos
Usa encabezados Markdown sencillos. Evita el texto publicitario. Di qué es el sitio en una o dos frases.
Mal:
Estamos revolucionando el futuro de la excelencia digital con soluciones de nueva generación.
Mejor:
Acme Docs publica documentación técnica para la API de pagos de Acme, incluida autenticación, webhooks, SDKs y guías de migración.
4. Añade lenguaje de política con cuidado
Tu sección de política debe ser comprensible sin sonar demasiado segura. Por ejemplo:
Las páginas públicas pueden resumirse para búsqueda, accesibilidad y asistencia al usuario con atribución. La copia masiva, la creación de datasets o el entrenamiento de modelos requieren permiso.
Eso no garantiza el cumplimiento, pero es más claro que el silencio.
5. Publícalo y mantenlo
Colócalo en /llms.txt. Sírvelo como text/plain o como una respuesta de texto compatible. Enlaza solo a URLs canónicas. Revísalo cuando cambie tu arquitectura de información.
Un llms.txt obsoleto es peor que no tener archivo, porque da instrucciones seguras que ya no son ciertas.
¿Todos los sitios deberían tener uno?
No.
Un sitio de folleto de cinco páginas probablemente no necesita llms.txt. Un restaurante local no necesita uno salvo que tenga políticas estructuradas o información de reservas que los asistentes de IA suelen expresar mal.
Se vuelve más útil cuando:
- tu sitio tiene mucha documentación;
- el contenido antiguo compite con el contenido nuevo;
- publicas investigación o material editorial;
- las licencias y la atribución importan;
- los asistentes de IA resumen tus páginas con frecuencia;
- los equipos internos necesitan una política compartida para el contenido público.
También es útil como parte de un ejercicio interno de gobernanza. Muchas empresas ya tienen empleados pegando páginas web, documentación y material de clientes en sistemas de IA. Si te resulta familiar, realiza una auditoría básica de IA en la sombra antes de asumir que un archivo de texto público solucionará el riesgo.
Implicaciones para SEO
llms.txt no es un factor de posicionamiento en ningún sentido establecido. No escribas uno porque esperas un aumento de tráfico la semana que viene.
El caso indirecto para SEO es más modesto:
- obliga a pensar en lo canónico;
- puede ayudar a los sistemas de búsqueda y respuesta mediados por IA a entender tu sitio;
- aclara las preferencias de atribución;
- reduce la ambigüedad en torno a páginas archivadas;
- crea una política pública e inspeccionable de uso de contenido por IA.
Eso vale la pena para algunos sitios. No es una capa mágica de optimización.
La mejor versión de llms.txt es pequeña, actual y alineada con el resto de tu sitio. Si tus reglas de robots, página de términos, sitemap, etiquetas canónicas y llms.txt dicen cosas distintas, el problema no es el rastreo de IA. El problema es la gobernanza.
<!-- tool-cta:start -->
💡 Prueba esto: Como llms.txt no es exigible, combínalo con reglas exigibles y compruébalas en Robots.txt Tester para que los rastreadores que sí obedecen los estándares se comporten correctamente.
<!-- tool-cta:end -->
Una recomendación final
Si tu sitio tiene documentación, contenido editorial o preocupaciones de licencia, crea un llms.txt sencillo. Mantenlo por debajo de unas pocas decenas de líneas. Úsalo para señalar recursos canónicos e indicar tus preferencias de reutilización.
Pero no confundas comunicación con control.
Para bloquear, usa los mecanismos de rastreo disponibles y comprende sus límites. Para la política, publica términos claros. Para la confianza, sé transparente con los lectores. llms.txt pertenece a ese conjunto como una señal útil, no como un escudo.