GPTBot, ClaudeBot et PerplexityBot n'ont jamais publié une seule phrase confirmant qu'ils lisent la balise meta robots noindex. La documentation d'OpenAI pour ses crawlers, celle d'Anthropic pour les trois bots de Claude, et la référence des crawlers de Perplexity décrivent toutes un seul et même mécanisme de contrôle : robots.txt. Des milliers de sites ajoutent encore noindex aux pages qu'ils veulent exclure des réponses IA, en supposant que cela fonctionne comme pour Google. Ce n'est pas le cas, car noindex a été conçu pour l'index d'un moteur de recherche, pas pour un assistant IA indépendant décidant quoi récupérer et citer. Ce qui régit réellement ces trois crawlers est plus étroit, plus fragile, et mérite d'être compris avant de s'y fier.
Ce que la balise noindex a réellement été conçue pour faire
Noindex est une instruction qu'un moteur de recherche lit après avoir déjà récupéré une page, lui indiquant de ne pas afficher cette page dans ses propres résultats. La documentation de Google sur la balise meta robots le définit précisément : la directive indique à Google de « ne pas afficher cette page, ce média ou cette ressource dans les résultats de recherche ». Cela ne fonctionne que parce que Googlebot vérifie la présence de cette balise sur chaque page qu'il explore, et que le pipeline de classement de Google est conçu pour la respecter lorsqu'elle est trouvée.
Un assistant IA indépendant est un pipeline entièrement différent, construit par une entreprise différente, sans aucune obligation de vérifier une balise que Google a définie pour ses propres résultats de recherche.
Aucun des trois grands assistants IA ne documente le fait de la lire
La documentation d'OpenAI sur ses crawlers nomme trois agents distincts : GPTBot, qui collecte des données pour l'entraînement des modèles ; OAI-SearchBot, qui indexe les pages pour ChatGPT Search ; et ChatGPT-User, qui récupère une seule page parce qu'une personne a posé une question directe à ChatGPT. La page explique, agent par agent, comment autoriser ou bloquer chacun d'eux via robots.txt. Elle ne dit rien des balises meta, noindex compris.
Anthropic applique la même répartition en trois pour Claude : ClaudeBot collecte les données d'entraînement, Claude-SearchBot indexe les pages pour la recherche, et Claude-User récupère une page en direct, pour le compte d'un utilisateur. La page d'assistance d'Anthropic indique seulement que ses bots « respectent les signaux de “non-exploration” en honorant les directives standard du secteur dans robots.txt », et une analyse de Search Engine Journal sur cette documentation, publiée en février 2026, a révélé que la granularité ajoutée concernait entièrement la chaîne de user-agent qu'un site bloque, et non une quelconque balise HTML.
Perplexity trace une ligne identique entre ses deux agents. Sa documentation sur les crawlers recommande d'autoriser PerplexityBot, qui indexe le contenu, dans robots.txt, et précise par ailleurs que Perplexity-User, qui ne récupère une page que parce qu'une personne s'y est intéressée, ignore généralement robots.txt dans son ensemble, car la requête se comporte davantage comme une personne cliquant sur un lien que comme un bot indexant un site. Une balise meta n'apparaît dans aucune des deux descriptions. Trois éditeurs, trois ensembles d'agents, et la même lacune dans chacune de leurs règles publiées.
C'est robots.txt qui les régit réellement, et même cela n'est pas absolu
Le seul signal que les trois éditeurs documentent réellement est robots.txt, le fichier texte brut qu'un site publie à sa racine et qui liste quels user-agents peuvent récupérer quels chemins. Un examen plus approfondi de ce que couvre réellement la règle robots.txt de chaque bot montre à quel point ces règles s'appliquent différemment lorsqu'un agent effectue une récupération en direct plutôt qu'une exploration autonome.
OpenAI est explicite sur la limite de ce fichier pour l'un de ses propres agents. Sa documentation indique clairement que les récupérations de ChatGPT-User ne constituent pas une exploration autonome, et que pour cette raison :
Ces actions étant initiées par un utilisateur, les règles de robots.txt peuvent ne pas s'appliquer.
Le rapport State of the Bots de TollBit pour le premier semestre 2026 a mesuré la fréquence à laquelle cet écart se manifeste en pratique : environ 15 % des robots de récupération de pages IA identifiés ont atteint des URL que le robots.txt d'un site avait explicitement interdites. ChatGPT-User, Bytespider et Youbot ont chacun encore atteint du contenu bloqué sur près de la moitié des sites européens qui les interdisaient, contre 9 % pour Claude-User et 13 % pour Perplexity-User en Europe, un taux qui grimpe à 26 % pour les deux bots en Amérique du Nord.
Un taux de contournement est un problème différent d'un crawler mentant sur son identité, ce qui mérite d'être vérifié séparément. C'est aussi un problème différent du fait d'exclure une marque de l'entraînement IA, car une règle Disallow écrite pour GPTBot n'empêche en rien Claude-SearchBot, PerplexityBot, ou tout autre agent de lire la même page à une fin différente. Un site qui veut une couverture réelle doit nommer explicitement chaque agent et revoir la liste à chaque fois qu'un éditeur en ajoute un.
Les AI Overviews de Google sont le seul endroit où une balise meta s'applique bel et bien, mais pas noindex
La documentation actuelle de Google sur la balise meta robots, révisée pour la dernière fois en mars 2026, trace une ligne que les trois assistants indépendants n'ont jamais tracée. Elle indique que la directive nosnippet « empêchera également le contenu d'être utilisé comme entrée directe pour les AI Overviews et le Mode IA », et que max-snippet limite « la quantité de contenu pouvant être utilisée comme entrée directe » dans ces mêmes fonctionnalités. Noindex fonctionne toujours comme avant : retirer une page de l'index de Google la retire par extension de Google AI Overviews, puisque les AI Overviews s'appuient sur les pages indexées, mais Google ne présente jamais noindex lui-même comme un contrôle spécifique à l'IA. Les leviers qu'il nomme spécifiquement pour les AI Overviews et le Mode IA sont nosnippet et max-snippet, et tous deux ne s'appliquent qu'à l'intérieur des propres fonctionnalités IA de Google, pas à ChatGPT, Claude ou Perplexity.
La documentation de Google couvre aussi le contenu qui n'est pas en HTML. Un PDF, par exemple, n'a pas de section head pour porter une balise meta, donc Google lit l'instruction équivalente depuis un en-tête HTTP X-Robots-Tag envoyé avec le fichier à la place. La documentation de GPTBot, ClaudeBot ou PerplexityBot ne mentionne pas non plus cet en-tête, ce qui signifie que le même écart qui s'applique à noindex sur une page HTML s'applique à un PDF ou une image interdit : robots.txt reste le seul levier que nomment les trois éditeurs.
Ce qu'il faut réellement vérifier si vous voulez exclure les crawlers IA
Commencez par un journal serveur plutôt que par une page de paramètres. Un journal montre quels agents nommés demandent réellement une page et quel code de réponse ils ont reçu, ce qui est le seul moyen de confirmer qu'une règle robots.txt a bien pris effet plutôt que de le supposer. Écrivez les règles Disallow en fonction de la chaîne exacte de l'agent à bloquer (GPTBot n'est pas OAI-SearchBot, et ClaudeBot n'est pas Claude-User), et revérifiez-les chaque fois qu'un éditeur scinde un bot en deux, comme Anthropic et OpenAI l'ont tous deux fait. Une balise noindex laissée sur ces mêmes pages ne fait rien pour aucun des trois, et elle mérite tout de même d'être retirée une fois que vous avez une règle robots.txt qui fonctionne réellement, car un noindex égaré peut discrètement empêcher une page d'atteindre Google et ses AI Overviews, même une fois la question des crawlers IA réglée.
Les paramètres de gestion des bots de Cloudflare classent désormais les crawlers en trois catégories, Search, Agent et Training, depuis septembre 2026, et ce classement détermine si une requête atteint le serveur avant même que le moindre fichier robots.txt ou balise meta ne soit lu.
Questions fréquemment posées
L'ajout d'une balise noindex empêche-t-il ChatGPT, Claude ou Perplexity de citer une page ?
Non. La documentation d'OpenAI, d'Anthropic et de Perplexity sur leurs propres crawlers décrit robots.txt comme le seul signal de contrôle pour GPTBot, ClaudeBot, PerplexityBot et leurs agents associés. Aucun des trois ne mentionne la lecture de la balise meta robots noindex. Noindex régit le fait qu'une page apparaisse ou non dans l'index propre d'un moteur de recherche, comme celui de Google, et non le fait que le crawler d'un assistant IA indépendant la récupère ou la cite.
Qu'est-ce qui contrôle réellement si GPTBot, ClaudeBot ou PerplexityBot peut accéder à une page ?
Robots.txt, et plus précisément la chaîne exacte de user-agent que publie chaque éditeur. GPTBot, OAI-SearchBot et ChatGPT-User sont trois agents distincts chez OpenAI ; ClaudeBot, Claude-SearchBot et Claude-User sont trois agents distincts chez Anthropic. Une règle Disallow doit nommer l'agent précis qu'un site veut bloquer, car bloquer l'un ne bloque pas les autres qui lisent la même page à une fin différente.
Robots.txt arrête-t-il ces crawlers de façon fiable ?
Pas entièrement. Le rapport State of the Bots de TollBit pour le premier semestre 2026 a constaté qu'environ 15 % des robots de récupération de pages IA identifiés ont atteint des URL que le robots.txt de leur site avait interdites, ChatGPT-User, Bytespider et Youbot atteignant du contenu bloqué sur près de la moitié des sites européens qui les nommaient. Robots.txt est une requête publiée qu'un crawler est censé respecter, pas une barrière technique qu'il ne peut pas franchir.
Pourquoi ChatGPT accède-t-il parfois encore à des pages interdites dans robots.txt ?
Parce que ChatGPT-User, l'agent qui récupère une page lorsqu'une personne interroge directement ChatGPT à son sujet, est explicitement documenté par OpenAI comme se comportant différemment de GPTBot ou d'OAI-SearchBot. OpenAI indique que, ces récupérations étant initiées par un utilisateur, les règles de robots.txt peuvent ne pas s'y appliquer, car la requête ressemble davantage à une personne cliquant sur un lien qu'à une exploration autonome.
Les AI Overviews de Google respectent-elles noindex ?
Indirectement. Noindex retire une page de l'index de Google, et les AI Overviews s'appuient sur les pages indexées, donc une page en noindex n'y apparaîtra pas non plus. Mais la documentation de Google sur la balise meta robots ne présente pas noindex comme un contrôle des AI Overviews. Les directives qu'elle nomme spécifiquement pour les AI Overviews et le Mode IA sont nosnippet et max-snippet, qui limitent toutes deux la quantité de contenu que ces fonctionnalités peuvent utiliser.
Que doit réellement faire un site s'il veut exclure des crawlers IA spécifiques ?
Vérifiez d'abord les journaux serveur pour voir quels agents nommés demandent réellement les pages, car les outils d'analyse passent entièrement à côté du trafic des crawlers. Écrivez les règles Disallow de robots.txt en fonction de la chaîne exacte de l'agent, et non d'un caractère générique. Pour une garantie qui ne dépend pas d'une conformité volontaire, bloquez au niveau du serveur ou du CDN, comme le font les catégories de bots Search, Agent et Training de Cloudflare.



