Crawler IA

Axel MalischewskiFondateur de Scaly

Mis à jour le

Qu'est-ce qu'un crawler IA ?

Un crawler IA est un robot d'exploration opéré par un fournisseur de modèles — GPTBot, ClaudeBot, PerplexityBot, Google-Extended. Bloqué dans le robots.txt, il ne peut ni lire ni citer votre site.

Trois usages derrière un même robot

Les robots des fournisseurs d'IA font trois choses distinctes : collecter des données d'entraînement, aller chercher une page en direct pour répondre à une question, et alimenter un index de recherche. Un même éditeur utilise souvent plusieurs agents, un par usage.

La conséquence est directe : bloquer l'agent de récupération en direct empêche votre site d'être cité dans une réponse, même si vous êtes par ailleurs très bien référencé. Beaucoup de sites le font sans l'avoir décidé, par héritage d'un robots.txt copié.

Décider en connaissance de cause

  • Autoriser les agents de recherche et de citation si la visibilité prime : c'est la condition pour apparaître dans les réponses.
  • Distinguer l'entraînement du reste : Google-Extended, par exemple, ne concerne pas l'indexation classique.
  • Vérifier ce que votre robots.txt autorise réellement aujourd'hui, avant d'en discuter.
  • Compléter avec l'en-tête Content-Signal, que certains agents lisent sans passer par robots.txt.

Exemple concret

Depuis la refonte, le robots.txt d’un fabricant de palettes interdit GPTBot et PerplexityBot, deux lignes héritées d’un gabarit que personne n’a relu. Les journaux du serveur montrent ces agents revenir chaque semaine et repartir sans rien lire. Aucun arbitrage n’a eu lieu sur ce point. Le fichier se corrige en une ligne, encore faut-il que quelqu’un l’ouvre.

À retenir

Le choix est stratégique, pas technique. Refuser l'exploration protège un contenu qu'on monétise ; l'autoriser est la condition d'entrée pour une entreprise qui cherche à être trouvée.

Questions fréquentes

Quels sont les principaux crawlers IA ?

GPTBot et OAI-SearchBot pour OpenAI, ClaudeBot et Claude-SearchBot pour Anthropic, PerplexityBot pour Perplexity, Google-Extended pour les usages génératifs de Google, Applebot-Extended pour Apple.

Bloquer GPTBot empêche-t-il d'apparaître dans ChatGPT ?

Cela empêche l'usage de vos pages pour l'entraînement. Pour la recherche en direct, c'est l'agent dédié qui compte : bloquer les deux revient à se rendre invisible dans les réponses.

Comment vérifier qu'un robot passe sur mon site ?

Dans les journaux du serveur, en filtrant par user-agent. C'est la seule preuve fiable : les outils d'analyse côté navigateur ne voient pas les robots.

Et sur votre site, ça donne quoi ?

Envoyez votre site, votre LinkedIn ou quelques lignes sur votre activité. Vous recevez une première lecture : ce qui manque, ce qui bloque, et par quoi commencer.