C’est la première chose à vérifier, avant tout le reste : si les robots des IA ne peuvent pas lire votre site, aucune optimisation ne sert à rien. Un robot qui ne peut pas atteindre votre page ne peut pas la citer. Et ce blocage est plus fréquent qu’on ne l’imagine — un audit de 2026 a trouvé que 41 % des sites B2B bloquaient encore au moins un robot d’IA majeur, le plus souvent sans le savoir.
C’est le point de départ concret pour quiconque veut agir. Cette page fait partie d’un ensemble consacré aux leviers qui rendent un site citable par les IA — et c’est le tout premier d’entre eux.
Comment un site se retrouve bloqué sans le savoir
Le blocage vient rarement d’une décision consciente. Il vient de trois sources, presque toujours involontaires.
Un héritage de 2023-2024. Quand la question de l’entraînement des IA a agité le web, beaucoup de sites ont ajouté des blocages « par précaution ». Ces règles sont restées, alors même que le débat a changé de nature. La plupart des propriétaires ont oublié qu’elles existaient.
Un plugin SEO. Plusieurs extensions WordPress et Shopify ont ajouté, en 2024 et 2025, une case « bloquer les robots d’IA » — parfois cochée par défaut. Une simple mise à jour de plugin a suffi, sur de nombreux sites, à couper l’accès à ChatGPT, Claude et Perplexity du jour au lendemain.
Un réglage du CDN ou du pare-feu. Cloudflare propose une option « bloquer les robots d’IA » activable en un clic — et elle prend le pas sur tout le reste. Un site peut avoir un fichier robots.txt parfait et rester bloqué à un niveau supérieur, sans que rien ne l’indique dans le fichier.
La distinction que presque tout le monde rate
Voici le point le plus important de cette page, et l’erreur la plus répandue.
Chaque grand acteur de l’IA fait tourner plusieurs robots, aux rôles opposés :
- Un robot d’entraînement, qui collecte du contenu pour nourrir les futurs modèles. Chez OpenAI, c’est
GPTBot. Chez Anthropic,ClaudeBot. - Un robot de recherche et récupération, qui indexe les pages pour composer les réponses citées. Chez OpenAI, c’est
OAI-SearchBot. Chez Anthropic,Claude-SearchBot. Chez Perplexity,PerplexityBot. - Un robot déclenché par l’utilisateur, qui va chercher une page précise quand quelqu’un le demande.
ChatGPT-User,Claude-User,Perplexity-User.
Bloquer l’un ne bloque pas les autres. Et surtout : les deux familles ont des effets inverses.
Bloquer un robot d’entraînement empêche votre contenu de nourrir les futurs modèles — c’est un choix de propriété, sans aucun effet sur vos citations. Bloquer un robot de recherche vous retire des réponses des IA — c’est le sabordage involontaire le plus courant.
Concrètement : si vous bloquez GPTBot en croyant « protéger votre contenu », vous ne perdez rien côté citations. Mais si vous bloquez OAI-SearchBot, vous disparaissez des réponses de ChatGPT. Beaucoup de gens font le second en croyant faire le premier.
Les robots à autoriser pour être visible
Pour être éligible aux citations des principaux moteurs, ce sont les robots de recherche et de récupération qu’il faut laisser passer :
OAI-SearchBot,ChatGPT-User— pour ChatGPTClaude-SearchBot,Claude-User— pour ClaudePerplexityBot,Perplexity-User— pour PerplexityGooglebot— pour Google et les AI Overviews (à ne jamais bloquer : c’est aussi votre référencement classique)
Si la question de l’entraînement vous préoccupe, vous pouvez bloquer les robots d’entraînement (GPTBot, ClaudeBot, Google-Extended, Applebot-Extended) tout en gardant les robots de recherche autorisés. Vous restez cité, sans nourrir les modèles. C’est un choix légitime — à condition de viser le bon robot.
Comment vérifier, concrètement
Trois vérifications, dans l’ordre.
Lisez votre robots.txt. Ouvrez votre-domaine.fr/robots.txt dans un navigateur. Cherchez les noms ci-dessus. Toute ligne Disallow: / sous l’un d’eux signifie que vous êtes invisible pour ce moteur. Vérifiez aussi qu’aucune règle ne bloque l’accès à votre sitemap.xml — sans lui, les robots ne découvrent pas vos pages.
Vérifiez votre CDN ou pare-feu. Si votre robots.txt semble correct mais que les robots ne passent pas, le blocage est ailleurs. Sur Cloudflare : Sécurité → Bots → vérifiez que l’option de blocage des robots d’IA n’est pas active.
Regardez vos logs serveur. Ils vous disent quels robots viennent réellement, et lesquels. Cherchez-y les noms d’agents ci-dessus. C’est la preuve concrète que la porte est ouverte — ou fermée.
Deux limites à connaître
Le robots.txt est une convention, pas une barrière. C’est une demande polie que les robots respectueux honorent — et les grands acteurs (OpenAI, Anthropic, Google, Perplexity) s’engagent publiquement à la respecter. Mais certains robots l’ignorent : les bloquer vraiment demande une règle au niveau du serveur ou du pare-feu, pas une simple ligne dans le fichier.
Enfin, ce paysage bouge vite : de nouveaux robots apparaissent plusieurs fois par an, et les noms changent. Une configuration écrite en 2023 est probablement périmée. C’est un réglage à revoir régulièrement — au moins après chaque mise à jour de plugin ou de CMS, moment où les blocages accidentels se réintroduisent le plus souvent.