La documentation d'OpenAI pour GPTBot, l'article d'assistance d'Anthropic pour ClaudeBot et la documentation de Perplexity pour PerplexityBot expliquent chacune ce que fait le robot et comment le bloquer. Aucun des trois ne dit un seul mot sur rel=canonical. Pour un signal qui façonne la manière dont Google indexe le contenu dupliqué depuis plus d'une décennie, ce silence est frappant, et il signifie que la balise canonique logée dans l'en-tête d'une page pourrait ne servir à rien pour les moteurs qui décident désormais si ChatGPT, Claude ou Perplexity mentionnent une marque.
Ce que rel=canonical indique réellement à Google
Une balise canonique indique à Google quelle URL, parmi plusieurs pages quasi identiques, doit représenter ce contenu dans les résultats de recherche. La documentation de Google sur la canonicalisation décrit ce processus comme le choix de la page qui, d'après les signaux collectés pendant l'indexation, est objectivement la plus complète et la plus utile pour les internautes, en pesant le statut HTTPS, la présence dans le sitemap, les redirections et l'annotation rel=canonical elle-même.
Google précise explicitement qu'un canonical déclaré est une indication, pas une règle. L'entreprise peut l'ignorer, et le fait, lorsque ses propres signaux contredisent la préférence du webmaster. Cette réserve compte aussi ici : si Google traite son signal de contenu dupliqué le mieux documenté comme négociable, rien ne permettait de supposer qu'un grand modèle de langage traiterait un signal non documenté comme contraignant.
Ce que disent à ce sujet les documentations de GPTBot, ClaudeBot et PerplexityBot
Une fois la marque mise de côté, les documentations des trois principaux crawlers IA couvrent le même terrain restreint : à quoi sert le robot, et comment robots.txt l'arrête. Le contenu dupliqué, les URL quasi identiques et la canonicalisation n'apparaissent dans aucune des trois.
La documentation pour développeurs de GPTBot indique qu'OpenAI utilise ce crawler « pour explorer du contenu qui peut être utilisé pour entraîner nos modèles de fondation d'IA générative », et que le bloquer dans robots.txt retire un site de ce circuit. L'article d'assistance d'Anthropic pour ClaudeBot, Claude-SearchBot et Claude-User couvre le même terrain pour ses trois robots : ce que fait chacun, et quelle directive robots.txt l'arrête. La documentation de PerplexityBot est plus mince encore, centrée presque entièrement sur les règles d'autorisation et de blocage. Aucune des trois ne documente ce qui se passe lorsqu'un crawler rencontre cinq URL servant le même paragraphe.
Une balise canonique est une demande que Google est prêt à négocier. C'est une demande que les crawlers IA qui lisent un site n'ont jamais accepté de recevoir.
Comment la récupération IA décide réellement entre des pages quasi dupliquées
Plutôt que de lire une balise canonique, les systèmes de récupération derrière ChatGPT, Claude et Perplexity découpent une page en passages par chunking, génèrent un embedding pour chaque passage, et comparent ces embeddings à la requête. Lorsque plusieurs pages d'un même domaine produisent des embeddings quasi identiques, le modèle les traite comme une seule entité et n'en conserve qu'une.
Fabrice Canel et Krishna Madhavan, de Bing, ont confirmé exactement ce comportement dans un article publié en décembre 2025 sur le Bing Webmaster Blog : les URL quasi dupliquées sont regroupées, et le modèle « peut sélectionner une version obsolète ou qui n'est pas celle que vous visiez ». VizibleAI a détaillé ce que ce regroupement coûte à une marque dans son article sur la cannibalisation de contenu et les citations IA, et le même mécanisme s'applique chaque fois que des pages dupliquées ne diffèrent que par une balise canonique, et non par quelque chose que le système de récupération peut réellement lire.
Ce qui prédit la citation à la place, selon l'étude d'Ahrefs sur 1,4 million de prompts
Ahrefs a analysé 1,4 million de prompts ChatGPT datant de février 2025 et a constaté que le modèle ne cite qu'environ la moitié des URL qu'il récupère par requête, en se basant sur la proximité entre le titre et l'URL d'une page et la question posée, et non sur le domaine ou la page qu'un webmaster a marqués comme canoniques.
Les URL citées correspondaient aux sous-questions sous-jacentes d'une requête avec une similarité cosinus de 0,656, contre 0,484 pour les URL récupérées mais non citées. Les pages avec des slugs d'URL en langage naturel affichaient un taux de citation de 89,78 %, contre 81,11 % pour celles qui n'en avaient pas. L'analyse du query fan-out par VizibleAI explique pourquoi cette étape de correspondance aux sous-questions pèse autant : la plupart des dizaines de requêtes dérivées par fan-out qu'une recherche génère n'affectent pas du tout la citation, mais les quelques-unes qui comptent se gagnent sur la formulation, pas sur un signal canonique. L'analyse d'Ahrefs n'a jamais eu besoin de mesurer les balises canoniques, et cette absence est en elle-même révélatrice : une étude construite sur 1,4 million de prompts réels avait toutes les raisons de signaler la canonicalisation comme un facteur si elle s'était révélée en être un.
Une marque doit-elle encore ajouter des balises canoniques pour les crawlers IA ?
Oui, mais comme un minimum requis pour le SEO classique plutôt que comme un levier sur les citations IA spécifiquement. Une balise canonique consolide toujours l'index Google d'un domaine, ne coûte toujours rien à maintenir, et compte toujours pour tout outil construit sur les données de Google. Elle ne fera simplement pas fusionner les pages dupliquées chez GPTBot, ClaudeBot ou PerplexityBot comme elle le fait pour Google.
Deux ajustements comptent plus que la balise elle-même. Si l'annotation canonique est injectée par du JavaScript côté client plutôt que présente dans le HTML initial, il faut supposer que plusieurs crawlers ne la voient jamais, puisqu'aucune des trois documentations ne confirme qu'ils exécutent le code côté client avant de lire une page. Et partout où une page dupliquée n'a aucune raison de rester en ligne, utiliser une vraie redirection 301 plutôt que de s'appuyer sur la seule balise, puisqu'une redirection élimine l'ambiguïté qu'un canonical ne fait que suggérer.
Associer la page conservée, quelle qu'elle soit, à des données structurées qui nomment explicitement l'entité. La question de l'accès est distincte de la question de la citation ; le tour d'horizon de VizibleAI sur ce que chaque grand crawler IA respecte réellement dans robots.txt couvre cet autre aspect de la même consolidation. Une balise canonique sans signal au niveau de la récupération derrière elle n'est qu'une note laissée à un moteur dont on n'a jamais confirmé qu'il lisait les notes.
Questions fréquemment posées
Les crawlers IA comme GPTBot, ClaudeBot ou PerplexityBot respectent-ils les balises canoniques ?
Leur propre documentation ne mentionne jamais les balises canoniques. Celles de GPTBot et ClaudeBot décrivent l'objectif du crawling et la conformité à robots.txt ; celle de PerplexityBot se concentre sur les règles d'autorisation et de blocage. Aucune ne décrit l'usage de rel=canonical pour résoudre les pages dupliquées, et les recherches indépendantes sur ce qui prédit les citations IA, dont l'étude d'Ahrefs sur 1,4 million de prompts, ne trouvent pas le signal canonique parmi les facteurs qui comptent.
Comment les moteurs IA choisissent-ils entre des pages dupliquées ou quasi identiques si ce n'est pas par la balise canonique ?
Ils découpent chaque page en passages, génèrent un embedding pour chaque segment, et comparent ces embeddings à la requête. Lorsque plusieurs pages d'un même domaine produisent des embeddings quasi identiques, le modèle les regroupe et n'en conserve qu'un représentant, un schéma que l'équipe webmaster de Bing a confirmé publiquement en décembre 2025.
Faut-il supprimer les balises canoniques puisque les crawlers IA les ignorent ?
Non. Les balises canoniques consolident toujours un site dans l'index de Google et ne coûtent rien à maintenir, donc il faut continuer à les utiliser pour le SEO classique. Il ne faut simplement pas attendre de la balise qu'elle contrôle quelle page dupliquée un moteur IA cite ; utiliser plutôt des redirections 301 pour les vrais doublons et des données structurées pour renforcer quelle page fait autorité.
Google traite-t-il les balises canoniques de la même façon que les crawlers IA ?
Non. Google documente la canonicalisation comme une décision pondérée utilisant des signaux incluant le statut HTTPS, les sitemaps, les redirections et un rel=canonical déclaré, qualifiant cette préférence d'« indication, pas une règle ». La documentation propre aux crawlers IA ne décrit aucun processus équivalent.
Qu'est-ce qui détermine réellement quelle page un moteur IA cite lorsque des doublons existent ?
L'analyse d'Ahrefs sur 1,4 million de prompts ChatGPT a montré que la citation est corrélée à la proximité entre le titre et l'URL d'une page et les sous-questions sous-jacentes d'une requête, ainsi qu'aux slugs d'URL formulés en langage naturel et à la fraîcheur relative, et non au signal canonique ou à la seule autorité de domaine.



