Budget de crawl

Axel MalischewskiFondateur de Scaly

Mis à jour le

Qu'est-ce que le budget de crawl ?

Le budget de crawl est le nombre de pages qu'un moteur explore sur un site pendant une période donnée. Il devient un sujet à partir de plusieurs milliers d'URL, rarement avant.

Une ressource limitée, mais rarement contraignante

Google alloue à chaque site une capacité d'exploration, fonction de la santé du serveur et de l'intérêt qu'il porte au contenu. Sur un site de quelques centaines de pages, cette capacité dépasse largement les besoins : le budget n'est pas le problème.

Il le devient sur les gros catalogues, les sites à filtres combinables et les architectures qui génèrent des URL à l'infini. Le robot passe alors son temps sur des variantes sans valeur pendant que les pages utiles attendent.

Ce qui le gaspille

  • Les pages de filtres et de tri accessibles sans restriction.
  • Les chaînes de redirections, chaque saut consommant une exploration.
  • Les pages d'erreur renvoyant un code 200 au lieu d'un 404.
  • Un serveur lent : le robot ralentit pour ne pas le surcharger.

Exemple concret

Un courtier en assurance laisse son comparateur produire une URL par combinaison de garanties et d’effectif. Googlebot passe ses journées là-dessus, pendant que les fiches métier publiées au printemps n’ont jamais reçu une seule requête. Le robots.txt interdit désormais les paramètres de tri et de filtre, et le sitemap ne liste plus que les fiches canoniques. Ce que le robot peut atteindre tient en quelques centaines d’adresses.

À retenir

Avant d'optimiser un budget de crawl, vérifiez que le problème existe : le rapport d'exploration de la Search Console montre ce que le robot visite réellement. Souvent, la vraie cause est ailleurs.

Questions fréquentes

À partir de combien de pages faut-il s'en préoccuper ?

En pratique, au-delà de quelques milliers d'URL, ou plus tôt si le site génère des combinaisons de filtres. En deçà, d'autres chantiers auront plus d'effet.

Comment savoir ce que le robot explore ?

Par les statistiques d'exploration de la Search Console, et surtout par les journaux du serveur, qui donnent le détail des URL visitées et des codes renvoyés.

Bloquer des pages dans robots.txt économise-t-il du budget ?

Oui, c'est l'un des rares usages où le blocage se justifie. Attention : une page bloquée peut rester indexée sans contenu si des liens pointent vers elle.

Et sur votre site, ça donne quoi ?

Envoyez votre site, votre LinkedIn ou quelques lignes sur votre activité. Vous recevez une première lecture : ce qui manque, ce qui bloque, et par quoi commencer.