Voyez quels crawlers d’IA lisent votre site
Sachez quels crawlers d’OpenAI, d’Anthropic, de Perplexity, de Google et d’autres passent sur votre site, quelles pages ils lisent, lesquelles leur renvoient une erreur, et quelles visites se font seulement passer pour un crawler.
Les assistants IA lisent votre site, sans que vous le voyiez
La plupart des assistants IA récupèrent vos pages avec leurs propres crawlers : GPTBot et OAI-SearchBot pour ChatGPT, PerplexityBot pour Perplexity, ceux de Google pour Gemini et AI Overviews. Google Analytics ne montre pas ces visites : les crawlers exécutent rarement son tag, et GA4 écarte de toute façon les robots connus. Impossible donc de savoir s’ils passent, ce qu’ils lisent, ou s’ils tombent sur une erreur.
Comment ça marche
- Connectez votre site: Installez l’extension WordPress, ajoutez quelques lignes pour Cloudflare, Vercel, Netlify ou Node.js, ou laissez Vector ou Fluent Bit lire vos journaux Nginx ou Apache. Il suffit de quelques minutes et d’une clé API.
- Seules les visites des crawlers partent: Votre site ne signale une visite que si son user agent appartient à un crawler connu, une fois la page servie. Les visites des personnes ne sont jamais envoyées.
- Consultez l’onglet Crawlers: Les visites par jour et par plateforme d’IA, les pages les plus visitées, les crawlers les plus actifs, les pages en erreur, les faux crawlers, et un journal des visites exportable en CSV.
Ce que montre l’onglet Crawlers
- Visites par plateforme d’IA: Les visites des crawlers regroupées par produit, comme ChatGPT, Google, Copilot ou Perplexity, comparées à la période précédente.
- Pages et crawlers en tête: Les 10 pages les plus lues par les crawlers et les 10 crawlers les plus actifs, avec un graphique par jour et par crawler.
- Pages que les crawlers n’ont pas pu lire: Chaque page qui a répondu à un crawler par une erreur (statut 400 ou plus), avec le crawler et la date de sa dernière visite.
- Faux crawlers détectés: Les visites qui empruntaient le nom d’un crawler sans venir des adresses de son opérateur. Elles sont exclues de tous les autres chiffres.
Comment fonctionne l’Analyse des Crawlers
Connectez votre site en quelques minutes
Choisissez l’intégration qui correspond à votre site. Chacune ne signale que les visites des crawlers connus, une fois la page servie, et ne change jamais ce que reçoivent vos visiteurs. Si un envoi échoue, votre site continue de tourner normalement.
- Extension WordPress, Worker Cloudflare (offre gratuite comprise), Vercel ou Next.js, Netlify, Node.js ou Express
- Nginx ou Apache : Vector ou Fluent Bit lit vos journaux d’accès, rien à changer sur le site
- Webflow en passant par Cloudflare, et une API pour tout autre serveur
Voyez ce que lisent les crawlers, et ce qui échoue
Les pages les plus visitées montrent où les crawlers passent leur temps. La liste des erreurs montre les pages qu’ils n’ont pas pu lire, avec le code de statut, le crawler et la dernière visite : vous savez quelles pages corriger en premier.
- Les 10 pages et les 10 crawlers en tête sur 7, 30 ou 90 jours
- Des filtres par page, par code de statut et par crawler
- Chaque page qui a répondu par un statut de 400 ou plus, 404 et 500 compris
Vrai crawler ou imposteur
N’importe quel scraper peut se faire appeler GPTBot. Vizible vérifie chaque visite avec les listes d’IP que publient OpenAI, Anthropic, Google, Microsoft, Apple, Amazon, Perplexity et d’autres. Les faux sont signalés et sortent de vos chiffres.
- Vérifié : l’adresse figure dans la liste officielle de l’opérateur
- Faux : la liste est à jour et l’adresse n’y figure pas
- Non vérifiable : l’opérateur ne publie pas de liste (Grok, Meta, ByteDance…), et la visite compte quand même
Chaque visite, prête à exporter
Le journal liste chaque visite, de la plus récente à la plus ancienne : l’heure, le crawler, le code de statut, la méthode, la page, le domaine référent et la vérification. Exportez-le en CSV avec les filtres de votre choix.
- Jusqu’à 10 000 visites par export CSV
- Le détail gardé 90 jours, les totaux par jour 400 jours
- Googlebot et Bingbot comptés en totaux par jour, sans le détail des pages
Pourquoi c’est important
- Vérifiez que les assistants IA peuvent vous lire: Si GPTBot, ClaudeBot ou PerplexityBot n’apparaissent jamais, quelque chose les bloque peut-être : votre robots.txt, une règle de pare-feu ou votre CDN. Vous pouvez enfin le voir.
- Sachez quelles pages ils lisent: Voyez si les crawlers atteignent vos pages produit, tarifs et blog, ou s’ils passent leur temps sur d’anciennes adresses oubliées.
- Corrigez les erreurs qui les bloquent: Un crawler qui reçoit une 404 ou une 500 repart sans rien avoir lu. Corrigez les pages en erreur, en commençant par celles qu’ils visitent le plus.
- Repérez les faux crawlers: Voyez combien de visites se font passer pour des crawlers d’IA, et sous quels noms, avant de décider à quel point ouvrir votre site aux robots.
FAQ
Qu’est-ce que l’Analyse des Crawlers ?
C’est l’onglet Crawlers de Vizible AI. Il montre quels crawlers d’IA et quels robots de moteurs de recherche visitent votre site, quelles pages ils lisent, lesquelles leur répondent par une erreur, et si chaque visite venait vraiment de l’entreprise qui exploite le crawler.
Quels crawlers Vizible reconnaît-il ?
Au moins 40, nommés d’après la documentation de chaque opérateur quand elle existe : GPTBot, OAI-SearchBot et ChatGPT-User chez OpenAI, ClaudeBot, Claude-SearchBot et Claude-User chez Anthropic, PerplexityBot et Perplexity-User, les lecteurs IA de Google et Googlebot, Bingbot, Applebot, Amazonbot, meta-externalagent, Bytespider, CCBot, DuckAssistBot, MistralAI-User, les crawlers de Grok, et d’autres encore.
Comment connecter mon site ?
Dans l’onglet Crawlers, créez une clé API, puis suivez le guide de votre site : l’extension WordPress, un Worker Cloudflare (toutes les offres Cloudflare, gratuite comprise), Vercel ou Next.js, Netlify, Node.js ou Express, ou Vector et Fluent Bit pour les journaux Nginx et Apache. Tout autre serveur peut envoyer ses visites par l’API. Webflow fonctionne en passant par Cloudflare. Wix et Shopify ne le permettent pas aujourd’hui, et Squarespace seulement à vos risques.
Comment distinguez-vous un vrai crawler d’un faux ?
L’adresse IP de chaque visite est comparée aux listes que publient les opérateurs : OpenAI, Anthropic, Google, Microsoft, Apple, Amazon, Perplexity, DuckDuckGo, Common Crawl et d’autres. Ces listes sont mises à jour chaque nuit. Une adresse présente dans la liste donne « Vérifié ». Une adresse absente d’une liste à jour donne « Faux », et la visite sort de vos chiffres. Les crawlers dont l’opérateur ne publie aucune liste, ceux de Grok par exemple, sont « non vérifiables » et comptent quand même, tout comme les visites qui arrivent par un proxy qui masque la vraie adresse.
Stockez-vous les adresses IP ?
Non. L’adresse IP sert uniquement, en mémoire, à vérifier le crawler, puis elle est effacée. Vizible garde le nom du crawler, la page sans ce qui suit le « ? », le code de statut, la méthode, le domaine référent et l’heure. Les visites des personnes ne sont jamais envoyées.
Une visite de crawler veut-elle dire que je serai cité ?
Non. Une visite veut dire que le crawler a pu récupérer la page, pas qu’un assistant va la citer. Perplexity, par exemple, répond souvent à partir de son propre index sans revenir sur votre page. Servez-vous de l’Analyse des Crawlers pour vérifier que les crawlers peuvent lire vos pages, et du suivi de visibilité IA de Vizible pour savoir si vous êtes vraiment mentionné.
Pourquoi Gemini, AI Overviews ou Copilot n’apparaissent-ils pas comme des crawlers à part ?
Google alimente Gemini, AI Overviews et AI Mode avec ses propres crawlers : leurs visites comptent donc sous Google. Quand Gemini ouvre une page en direct, la requête arrive avec le seul mot « Google » comme user agent : Vizible l’affiche comme Gemini (live), dans la carte Google. Bingbot compte sous Copilot, puisque Copilot répond à partir de Bing.
Y a-t-il des limites ?
Un site par compte, tous ses sous-domaines compris. Jusqu’à 50 000 visites par jour sont gardées en détail ; au-delà, les visites sont quand même comptées dans les totaux du jour, qui restent toujours complets. Le détail est gardé 90 jours, les totaux par jour 400 jours. Googlebot et Bingbot ne sont comptés qu’en totaux par jour, sans le détail des pages.
Quels plans l’incluent ?
Tous les plans, essai gratuit de 7 jours compris.



