Crawlers IA bloqués dans le robots.txt
Mis à jour le 15 septembre 2026
Pourquoi c'est important
Un crawler IA de recherche est un robot qui parcourt le web pour alimenter les réponses d'un assistant, et qui cite ses sources en retour. Il ne faut pas le confondre avec un crawler d'entraînement, qui collecte du texte pour construire un modèle sans jamais renvoyer vers vous. Cette distinction est toute la question. Bloquer les seconds est un choix légitime, qui ne coûte rien en visibilité. Bloquer les premiers vous retire des réponses génératives : votre site n'y est plus cité, plus lié, plus mentionné, quel que soit le soin apporté à vos contenus. C'est le seul point de cette liste qui annule tous les autres d'un trait, au niveau du domaine entier. Le blocage est rarement une décision assumée. Il vient le plus souvent d'un modèle de robots.txt copié, d'une règle défensive ajoutée au moment des débats sur l'entraînement des modèles, ou d'une protection anti-bot activée par défaut chez un hébergeur. Beaucoup de sites bloquent ainsi des robots qui ne demandaient qu'à les citer. La décision reste la vôtre, et elle est stratégique avant d'être technique : autoriser, c'est accepter que votre contenu soit résumé, parfois sans clic, en échange d'une citation et d'une présence. Refuser, c'est choisir l'absence. Il n'y a pas de troisième voie.
Comment Bretzel SEO le détecte
Bretzel SEO lit le robots.txt de votre domaine et vérifie, pour chacun des principaux robots de recherche générative, s'il est autorisé à parcourir le site. Le résultat alimente l'axe technique du score GEO, aux côtés du rendu serveur. Le point n'est au vert que si aucun de ces robots n'est bloqué ; le libellé nomme ceux qui le sont. Trois précisions pour lire le rapport. Ce point est le seul évalué à l'échelle du site, et non page par page. Le robots.txt est un fichier de domaine : un seul fichier décide pour toutes vos URL. Seuls les robots qui citent leurs sources sont vérifiés. Ceux qui servent à l'entraînement des modèles ne sont pas contrôlés, parce que les bloquer est un arbitrage légitime, sans effet sur votre visibilité dans les réponses. Un point au vert ne signifie donc pas que vous laissez tout passer. Un robots.txt absent vaut autorisation. C'est la règle du protocole, pas une approximation : sans fichier, tout est permis. Limite assumée : si le fichier est momentanément injoignable au moment de l'analyse, l'outil considère que rien ne bloque. Un point au vert obtenu dans ces conditions ne prouve donc pas grand-chose. En cas de doute sur un résultat, relancez l'analyse et ouvrez le fichier vous-même.
Comment corriger
1. Ouvrez votre robots.txt et cherchez les blocs User-agent visant des robots d'IA. Un « Disallow: / » sous l'un d'eux suffit à vous retirer des réponses génératives. 2. Décidez robot par robot, pas en bloc. Autoriser ceux qui citent leurs sources tout en refusant ceux qui entraînent des modèles est une position cohérente, et c'est la plus courante. 3. Attention à la précédence des règles. Un groupe visant un robot précis l'emporte sur le groupe générique : une autorisation ajoutée dans « User-agent: * » ne débloquera pas un robot nommément interdit plus haut. 4. Vérifiez aussi ailleurs que dans le robots.txt. Un pare-feu applicatif, une protection anti-bot ou une règle CDN peuvent renvoyer un refus alors que le fichier autorise tout. C'est une cause fréquente de blocage invisible. 5. Tranchez la question en équipe avant de modifier quoi que ce soit. C'est un arbitrage éditorial et juridique, pas un réglage technique : documentez la décision pour qu'elle ne soit pas défaite au prochain déploiement. 6. Après modification, relancez une analyse et contrôlez que le fichier servi en production est bien celui que vous avez écrit.
Exemple avant/après
Avant, un éditeur de logiciel avait ajouté un blocage général des robots d'IA au moment des débats sur l'entraînement des modèles. Un an plus tard, sa documentation et ses comparatifs n'apparaissaient dans aucune réponse d'assistant, alors que ceux de ses concurrents y étaient cités quotidiennement. Le contenu était meilleur ; il était simplement inaccessible. Après arbitrage, l'entreprise a maintenu le blocage des robots d'entraînement et rouvert l'accès à ceux qui citent leurs sources. Le choix a été écrit dans la documentation technique pour éviter qu'il soit défait par inadvertance, et les pages sont redevenues éligibles à la citation.
Impact SEO
Impact maximal en tout ou rien : un blocage annule d'un coup l'ensemble du travail de citabilité, à l'échelle du domaine entier. Aucun effet en revanche sur le référencement classique, Googlebot étant un robot distinct. Le point relève de l'axe technique du score GEO, avec le rendu serveur. La correction se fait en une ligne de fichier, mais la décision qu'elle traduit mérite d'être prise pour de bon. Le suivi se fait en surveillant les citations de votre marque dans les assistants, et les visites référencées depuis leurs domaines dans vos statistiques.