Crawl budget : optimiser les visites du robot YperLine

Les 3 facteurs du crawl budget, 7 actions d'optimisation, les pages qui gaspillent le crawl et la checklist 10 points. Même sur un petit site.


Crawl budget : optimiser les visites du robot

Qu'est-ce que le crawl budget ?

Le crawl budget est le nombre de pages qu'un moteur de recherche est disposé à crawler sur un site sur une période donnée. Il est déterminé par 2 facteurs : la crawl rate (vitesse à laquelle le robot visite le site) et la crawl demand (nombre de pages que le robot veut visiter). Le crawl budget = crawl rate × crawl demand.

Contrairement à une idée reçue, le crawl budget n'est pas un nombre fixe imposé par Google. C'est une allocation dynamique : Google adapte le nombre de visites selon la taille du site, la fréquence de mise à jour et la qualité perçue du contenu.

Important : sur un site de moins de 1 000 pages, le crawl budget n'est presque jamais un problème. Googlebot visite l'intégralité du site en quelques jours. Le crawl budget devient un sujet à partir de ~10 000 pages, ou si le site contient beaucoup de pages inutiles.

Pourquoi ça compte (même sur un petit site)

Sur un site de 50 pages comme YperLine, le crawl budget total n'est pas la contrainte. Mais les principes du crawl budget s'appliquent dès la première page, car ils concernent 3 choses :

  1. La découverte : si les pages prioritaires sont à 4 clics de la home et que 30 pages inutiles sont à 1 clic, le robot explore d'abord les pages inutiles.
  2. Le re-crawl : une page modifiée hier a plus de chances d'être re-crawlée rapidement si le site est « propre » (peu de pages inutiles, maillage dense vers les pages clés).
  3. Les bots IA : GPTBot, PerplexityBot et ClaudeBot ont des crawl budgets beaucoup plus limités que Googlebot. Sur un site de 50 pages, ils ne vont probablement pas tout crawler. Il faut que les pages prioritaires soient les plus accessibles.

→ Guide : GEO : les crawlers IA ont un budget limité

Les 3 facteurs qui le déterminent

FacteurDescriptionImpact
Taille du siteNombre total de pages indexablesPlus le site est grand, plus le crawl rate diminue (Google répartit son crawl sur plus de domaines)
Fréquence de mise à jourComment souvent le contenu changeUn site mis à jour quotidiennement est re-crawlé plus souvent qu'un site statique
Qualité perçueRatio de pages utiles vs inutiles, erreurs de crawl, temps de réponseUn site avec beaucoup de 404, de timeouts ou de pages dupliquées voit son crawl rate réduit

En pratique pour un site de 50 pages : le facteur dominant est la qualité perçue. Si 10 pages sur 50 sont des 404, des pages de test ou des doublons, Googlebot « perd » 20 % de son temps sur votre site. Les bots IA, avec un budget 10 à 50 fois plus petit, peuvent tout simplement ne pas visiter vos pages clés.

7 actions pour optimiser son crawl budget

1. Maillage interne dense vers les pages prioritaires

Chaque page clé (piliers, services) doit être accessible en ≤ 2 clics depuis la home. Le maillage interne est le premier signal que le robot utilise pour prioriser ses visites. → Maillage interne

2. Éliminer les pages inutiles

Supprimer ou noindex :

  • Pages de test (/test.php, /tmp/).
  • Pages de catégories vides (0 article).
  • Pages de tags avec 1 seul article.
  • Pages de pagination inutiles (?page=2 sur une liste de 3 items).

3. Utiliser les canonicals

Si plusieurs URLs mènent au même contenu (http/https, www/non-www, ?paramètre), une balise <link rel="canonical"> indique la version à indexer. Le robot ne « perd » pas de crawl sur les doublons.

<link rel="canonical" href="https://yperline.net/seo-technique" />

4. Éviter les chaînes de redirection

A → B → C consomme 3 crawls au lieu de 1. Chaque hop dans une chaîne de redirection dilue l'autorité (estimé à 10-15 % de perte par hop) et ralentit le crawl. → Redirections 301

5. Réduire les temps de réponse serveur

Si le serveur met plus de 500 ms à répondre, le robot ralentit (timeout). Un TTFB élevé réduit le crawl rate. → Core Web Vitals

6. Soumettre le sitemap

Le sitemap XML est la liste « officielle » des pages à crawler. Il évite au robot de « chercher » les pages via le maillage seul. → Sitemap XML

7. Bloquer les dossiers inutiles dans robots.txt

/admin/, /tmp/, /assets/ (si non nécessaires au rendu) : bloquer ces dossiers dans robots.txt évite au robot de les explorer. → robots.txt

Les pages qui gaspillent le crawl

Type de pageExempleAction
Pages de paramètres/produit?couleur=rouge&taille=MCanonical vers la page principale ou noindex
Pages de pagination vides/articles?page=47 (0 résultat)404 ou 410
Pages de tags/labels/tag/seo avec 1 articleNoindex ou suppression
Pages de test / staging/test.php, /dev/Suppression ou blocage dans robots.txt
Pages de login / compte/login, /compteNoindex + blocage dans robots.txt
Pages de recherche interne/recherche?q=seoNoindex systématique
Fichiers non-HTML/feed.xml, /favicon.icoBlocage dans robots.txt (pas de valeur SEO)
Pages dupliquées/seo et /referencement (même contenu)301 vers l'une, ou canonical

Mesurer son crawl budget

Sur un petit site, la mesure est simple :

  1. Google Search Console → « Statistiques d'indexation » → « Pages » : voir le nombre de pages indexées vs le nombre total de pages du site. Si l'écart est grand, des pages ne sont pas indexées (noindex, 404, non découvertes).
  2. Log serveur : compter le nombre de requêtes Googlebot sur 24 h. Sur un site de 50 pages, Googlebot devrait visiter 30-50 pages/jour en phase d'indexation initiale, puis 5-15 pages/jour en phase de maintenance.
  3. Crawl interne : utiliser Screaming Frog (gratuit jusqu'à 500 URLs) pour détecter les 404 internes, les chaînes de redirection et les pages orphelines.
  4. Bots IA : filtrer les logs sur GPTBot, PerplexityBot, ClaudeBot. Voir combien de pages ils visitent sur 7 jours. Si ce sont 3 pages sur 50, le maillage vers les pages clés doit être renforcé.

Les 4 erreurs à éviter

#ErreurConséquence
1Laisser des pages de test en productionCrawl gaspillé + signal de site « inachevé »
2Chaînes de redirection de 3+ hopsPerte d'autorité + crawl 3× plus lent
3Pas de canonical sur les URLs avec paramètresDoublons indexés → dilution de l'autorité
4Maillage interne faible (pages clés à 4+ clics)Les bots IA ne les visitent pas → invisibles sur ChatGPT/Perplexity

Checklist crawl budget

#Point de contrôleStatut
1Toutes les pages clés accessibles en ≤ 2 clics depuis la home☐
2Pas de pages de test / staging en production☐
3Pas de chaîne de redirection > 1 hop (audit Screaming Frog)☐
4Pas de 404 internes (liens morts)☐
5Canonicals sur toutes les URLs avec paramètres☐
6Pages de login / recherche interne en noindex☐
7robots.txt : /admin/, /tmp/ bloqués☐
8Sitemap XML soumis dans GSC + Bing☐
9TTFB < 800 ms (pas de timeout crawler)☐
10Log serveur : bots IA visitent ≥ 5 pages / 7 jours☐

Pour le contexte plus large, voir notre page SEO technique. Pour le maillage interne (action n°1), voir Maillage interne. Pour la vue d'ensemble, voir le guide complet du SEO.

Optimisez votre crawl en 15 minutes

Audit SEO gratuit : nous analysons votre maillage, vos redirections et vos logs de crawl. Vous savez exactement quelles pages le robot visite et lesquelles il ignore.

Demander mon audit gratuit