La búsqueda con IA cambia cómo se encuentra su sitio web
ChatGPT, Claude, Perplexity y los AI Overviews de Google responden preguntas directamente, citando sitios web como fuentes. Usted puede influir en dos requisitos técnicos: ¿pueden los crawlers de IA leer sus páginas y tienen acceso técnico a los contenidos? Que una página llegue a seleccionarse o citarse depende además de los sistemas de selección y clasificación de cada proveedor. Esta página explica los controles técnicos, incluida la joven convención llms.txt.
¿Qué es llms.txt?
llms.txt es un archivo Markdown en la raíz de su sitio web (/llms.txt), análogo a robots.txt o sitemap.xml. Contiene un índice curado para sistemas de IA: el nombre de su sitio como título, una breve descripción como cita y, a continuación, listas de enlaces a sus páginas más importantes, cada una con una frase sobre su contenido.
La convención fue propuesta por Answer.AI en septiembre de 2024 y es deliberadamente simple: curar en lugar de volcarlo todo. Un buen llms.txt abarca las 10 a 30 páginas que realmente explican su oferta, no todo el sitemap.
Valoración honesta: llms.txt es una convención comunitaria joven, no un estándar oficial. Google ha declarado públicamente que no lee el archivo, y los grandes proveedores de IA no se han comprometido a utilizarlo. Los usos documentados se concentran hoy en herramientas de desarrollo, como editores de código con IA, y en plataformas de documentación. Nuestra recomendación: un archivo curado requiere un esfuerzo limitado y facilita a esas herramientas el acceso a sus contenidos; sin embargo, actualmente no hay un efecto demostrado sobre los resultados de búsqueda con IA. La palanca técnica más directa es el acceso de los bots vía robots.txt (más abajo).
live24h aplica la convención en su propio sitio: www.live24h.eu/llms.txt .
¿Qué son los crawlers de IA?
Los crawlers de IA son visitantes automatizados que recuperan páginas web para sistemas de IA. Lo decisivo es su finalidad, porque de ella depende lo que un bloqueo en robots.txt significa para usted:
- Búsqueda: construye el índice para respuestas de búsqueda con IA y citas. Un bloqueo impide que el crawler de búsqueda correspondiente recopile la página para ese fin; permitirlo no garantiza su inclusión ni su cita.
- Entrenamiento: recopila contenidos para entrenar modelos futuros. Bloquear un bot dedicado al entrenamiento no bloquea automáticamente el bot de búsqueda separado del mismo proveedor.
- Consulta en vivo: recupera una página en el momento en que un usuario pregunta por ella. Según los proveedores, las reglas de robots.txt pueden no aplicarse, o aplicarse solo en parte, a algunas de estas consultas.
Los bots más importantes de un vistazo:
| Bot (user agent) | Operador | Finalidad |
|---|---|---|
GPTBot | OpenAI | Entrenamiento |
OAI-SearchBot | OpenAI | Búsqueda con IA (búsqueda de ChatGPT) |
ClaudeBot / Claude-SearchBot | Anthropic | Entrenamiento / búsqueda con IA |
Googlebot | Búsqueda web, incluidos los AI Overviews | |
Google-Extended | Token de control: exclusión del entrenamiento de Gemini y del grounding de Gemini/Vertex (sin crawler propio) | |
PerplexityBot | Perplexity | Búsqueda con IA |
Bingbot | Microsoft | Búsqueda web, incluidas las respuestas de Copilot |
La tabla describe las finalidades documentadas de estos tokens de user-agent. Que un proveedor respete robots.txt en todos los casos es una cuestión distinta; en particular, las consultas en vivo pueden comportarse de otra manera.
Por qué robots.txt es la palanca técnica más directa
Para los bots que respetan sus reglas, robots.txt funciona como opt-out: los bots que no se restringen allí pueden rastrear. Para su visibilidad en IA, esto significa:
- Bloquear bots de búsqueda limita la capacidad de descubrimiento. Excluir a
OAI-SearchBot,Claude-SearchBot,PerplexityBot,GooglebotoBingbotimpide la recopilación mediante el crawler de búsqueda correspondiente. A la inversa, permitirlo no garantiza la inclusión ni la cita. - Bloquear bots dedicados al entrenamiento es una decisión legítima. Bloquear
GPTBot,ClaudeBotu optar por la exclusión víaGoogle-Extendedno bloquea automáticamente los crawlers de búsqueda separados: aquí decide usted sobre el uso para entrenamiento o grounding. - Un riesgo de configuración habitual son las listas de bloqueo copiadas que excluyen involuntariamente bots de búsqueda, o un
Disallow: /general. Ambos casos pueden limitar la capacidad de descubrimiento en la búsqueda convencional y asistida por IA.
Compruebe por tanto con precisión a qué bots afecta su robots.txt, y si eso corresponde a su intención.
Cómo ayuda live24h
El check SEO también cubre las señales técnicas de acceso para la IA. live24h supervisa robots.txt, meta robots y URLs canónicas de sus páginas más importantes, y observa además la perspectiva de la IA: ¿existe un llms.txt con una estructura plausible? ¿Bloquea su robots.txt bots de IA y, en tal caso, bots de búsqueda (riesgo para la capacidad de descubrimiento) o bots de entrenamiento (decisión deliberada)? Los resultados aparecen como indicaciones con contexto, sin empeorar el estado de su check. La guía de checks SEO muestra cómo configurarlos.
El plugin de WordPress crea su llms.txt. El plugin de live24h para WordPress genera un llms.txt curado directamente a partir de la información de su sitio (título, descripción, páginas más importantes) y respeta los archivos existentes en lugar de sobrescribirlos. La instalación se describe en la guía del plugin para WordPress .
Así la decisión queda en sus manos: facilitar la capacidad técnica de descubrimiento, controlar conscientemente el uso para entrenamiento y revisar ambos aspectos de forma periódica.