La recherche IA change la façon dont votre site est trouvé
ChatGPT, Claude, Perplexity et les AI Overviews de Google répondent directement aux questions — en citant des sites web comme sources. Vous pouvez agir directement sur deux prérequis techniques : les crawlers IA ont-ils le droit de lire vos pages, et les contenus leur sont-ils techniquement accessibles ? La sélection ou la citation effective d’une page dépend aussi des systèmes de classement et de sélection de chaque fournisseur. Cette page présente les leviers techniques — y compris la jeune convention llms.txt.
Qu’est-ce que llms.txt ?
llms.txt est un fichier Markdown à la racine de votre site web (/llms.txt), analogue à robots.txt ou sitemap.xml. Il contient une table des matières éditorialisée pour les systèmes d’IA : le nom de votre site en titre, une brève description en bloc de citation, puis des listes de liens vers vos pages les plus importantes — chacune avec une phrase sur son contenu.
La convention a été proposée par Answer.AI en septembre 2024 et reste volontairement simple : sélectionner plutôt que tout déverser. Un bon llms.txt couvre les 10 à 30 pages qui expliquent réellement votre offre — pas l’intégralité de votre sitemap.
Évaluation honnête : llms.txt est une jeune convention communautaire, pas un standard officiel. Google a déclaré publiquement ne pas lire ce fichier, et les grands fournisseurs d’IA ne se sont pas engagés à l’utiliser. Les usages documentés concernent aujourd’hui surtout des outils de développement comme les éditeurs de code IA et des plateformes de documentation. Notre recommandation : un fichier éditorialisé demande un effort limité et rend les contenus plus accessibles à ces outils — mais aucun effet sur les résultats de recherche IA n’est actuellement prouvé. Le levier technique le plus direct est l’accès des bots via robots.txt (ci-dessous).
live24h applique la convention à son propre site : www.live24h.eu/llms.txt .
Que sont les crawlers IA ?
Les crawlers IA sont des visiteurs automatisés qui récupèrent des pages web pour des systèmes d’IA. Ce qui compte, c’est leur finalité — elle détermine ce qu’un blocage dans robots.txt signifie pour vous :
- Recherche : construit l’index des réponses de recherche IA et des citations. Un blocage empêche le crawler concerné de collecter la page à cette fin ; l’autoriser ne garantit ni inclusion ni citation.
- Entraînement : collecte des contenus pour l’entraînement des futurs modèles. Bloquer un bot dédié à l’entraînement ne bloque pas automatiquement le bot de recherche distinct du même fournisseur.
- Récupération en direct : va chercher une page au moment où un utilisateur pose une question précise. Selon les fournisseurs, les règles robots.txt peuvent ne pas s’appliquer, ou seulement en partie, à certaines de ces requêtes.
Les bots les plus importants en un coup d’œil :
| Bot (user agent) | Opérateur | Finalité |
|---|---|---|
GPTBot | OpenAI | Entraînement |
OAI-SearchBot | OpenAI | Recherche IA (recherche ChatGPT) |
ClaudeBot / Claude-SearchBot | Anthropic | Entraînement / recherche IA |
Googlebot | Recherche web, AI Overviews inclus | |
Google-Extended | Jeton de contrôle : opt-out de l’entraînement Gemini et du grounding Gemini/Vertex (pas de crawler propre) | |
PerplexityBot | Perplexity | Recherche IA |
Bingbot | Microsoft | Recherche web, réponses Copilot incluses |
Le tableau décrit les finalités documentées de ces jetons user-agent. Le respect systématique des règles robots.txt par un fournisseur est une question distincte ; les récupérations en direct peuvent notamment se comporter différemment.
Pourquoi robots.txt est le levier technique le plus direct
Pour les bots qui en respectent les règles, robots.txt fonctionne par opt-out : les bots qui n’y sont pas restreints ont le droit de crawler. Pour votre visibilité IA, cela signifie :
- Bloquer les bots de recherche limite la découvrabilité. Exclure
OAI-SearchBot,Claude-SearchBot,PerplexityBot,GooglebotouBingbotempêche la collecte par le crawler de recherche concerné. À l’inverse, l’autoriser ne garantit ni inclusion ni citation. - Bloquer les bots dédiés à l’entraînement est un arbitrage légitime. Bloquer
GPTBot,ClaudeBotou se désinscrire viaGoogle-Extendedne bloque pas automatiquement les crawlers de recherche distincts — vous décidez ici de l’usage pour l’entraînement ou le grounding. - Un risque de configuration fréquent vient des listes de blocage copiées-collées qui excluent involontairement des bots de recherche, ou d’un
Disallow: /global. Ces deux cas peuvent limiter la découvrabilité dans la recherche classique et assistée par IA.
Vérifiez donc précisément quels bots votre robots.txt affecte — et si cela correspond à votre intention.
Comment live24h vous aide
Le check SEO couvre aussi les signaux techniques d’accès pour l’IA. live24h surveille robots.txt, meta robots et URL canoniques de vos pages les plus importantes — et regarde aussi la perspective IA : un llms.txt est-il présent et structuré de façon plausible ? Votre robots.txt bloque-t-il des bots IA, et si oui : des bots de recherche (risque pour la découvrabilité) ou des bots d’entraînement (choix délibéré) ? Les résultats apparaissent comme des indications contextualisées, sans dégrader le statut de votre check. Le guide des checks SEO montre comment les configurer.
Le plugin WordPress crée votre llms.txt. Le plugin live24h pour WordPress génère un llms.txt éditorialisé directement à partir des informations de votre site — titre, description, pages les plus importantes — et respecte les fichiers existants au lieu de les écraser. L’installation est décrite dans le guide du plugin WordPress .
La décision reste ainsi entre vos mains : permettre la découvrabilité technique, piloter consciemment l’usage pour l’entraînement et contrôler régulièrement ces deux aspects.