Crawl budget : optimiser les visites du robot
Qu'est-ce que le crawl budget ?
Le crawl budget est le nombre de pages qu'un moteur de recherche est disposé à crawler sur un site sur une période donnée. Il est déterminé par 2 facteurs : la crawl rate (vitesse à laquelle le robot visite le site) et la crawl demand (nombre de pages que le robot veut visiter). Le crawl budget = crawl rate × crawl demand.
Contrairement à une idée reçue, le crawl budget n'est pas un nombre fixe imposé par Google. C'est une allocation dynamique : Google adapte le nombre de visites selon la taille du site, la fréquence de mise à jour et la qualité perçue du contenu.
Pourquoi ça compte (même sur un petit site)
Sur un site de 50 pages comme YperLine, le crawl budget total n'est pas la contrainte. Mais les principes du crawl budget s'appliquent dès la première page, car ils concernent 3 choses :
- La découverte : si les pages prioritaires sont à 4 clics de la home et que 30 pages inutiles sont à 1 clic, le robot explore d'abord les pages inutiles.
- Le re-crawl : une page modifiée hier a plus de chances d'être re-crawlée rapidement si le site est « propre » (peu de pages inutiles, maillage dense vers les pages clés).
- Les bots IA : GPTBot, PerplexityBot et ClaudeBot ont des crawl budgets beaucoup plus limités que Googlebot. Sur un site de 50 pages, ils ne vont probablement pas tout crawler. Il faut que les pages prioritaires soient les plus accessibles.
Les 3 facteurs qui le déterminent
| Facteur | Description | Impact |
|---|---|---|
| Taille du site | Nombre total de pages indexables | Plus le site est grand, plus le crawl rate diminue (Google répartit son crawl sur plus de domaines) |
| Fréquence de mise à jour | Comment souvent le contenu change | Un site mis à jour quotidiennement est re-crawlé plus souvent qu'un site statique |
| Qualité perçue | Ratio de pages utiles vs inutiles, erreurs de crawl, temps de réponse | Un site avec beaucoup de 404, de timeouts ou de pages dupliquées voit son crawl rate réduit |
En pratique pour un site de 50 pages : le facteur dominant est la qualité perçue. Si 10 pages sur 50 sont des 404, des pages de test ou des doublons, Googlebot « perd » 20 % de son temps sur votre site. Les bots IA, avec un budget 10 à 50 fois plus petit, peuvent tout simplement ne pas visiter vos pages clés.
7 actions pour optimiser son crawl budget
1. Maillage interne dense vers les pages prioritaires
Chaque page clé (piliers, services) doit être accessible en ≤ 2 clics depuis la home. Le maillage interne est le premier signal que le robot utilise pour prioriser ses visites. → Maillage interne
2. Éliminer les pages inutiles
Supprimer ou noindex :
- Pages de test (
/test.php,/tmp/). - Pages de catégories vides (0 article).
- Pages de tags avec 1 seul article.
- Pages de pagination inutiles (?page=2 sur une liste de 3 items).
3. Utiliser les canonicals
Si plusieurs URLs mènent au même contenu (http/https, www/non-www, ?paramètre), une balise <link rel="canonical"> indique la version à indexer. Le robot ne « perd » pas de crawl sur les doublons.
<link rel="canonical" href="https://yperline.net/seo-technique" />
4. Éviter les chaînes de redirection
A → B → C consomme 3 crawls au lieu de 1. Chaque hop dans une chaîne de redirection dilue l'autorité (estimé à 10-15 % de perte par hop) et ralentit le crawl. → Redirections 301
5. Réduire les temps de réponse serveur
Si le serveur met plus de 500 ms à répondre, le robot ralentit (timeout). Un TTFB élevé réduit le crawl rate. → Core Web Vitals
6. Soumettre le sitemap
Le sitemap XML est la liste « officielle » des pages à crawler. Il évite au robot de « chercher » les pages via le maillage seul. → Sitemap XML
7. Bloquer les dossiers inutiles dans robots.txt
/admin/, /tmp/, /assets/ (si non nécessaires au rendu) : bloquer ces dossiers dans robots.txt évite au robot de les explorer. → robots.txt
Les pages qui gaspillent le crawl
| Type de page | Exemple | Action |
|---|---|---|
| Pages de paramètres | /produit?couleur=rouge&taille=M | Canonical vers la page principale ou noindex |
| Pages de pagination vides | /articles?page=47 (0 résultat) | 404 ou 410 |
| Pages de tags/labels | /tag/seo avec 1 article | Noindex ou suppression |
| Pages de test / staging | /test.php, /dev/ | Suppression ou blocage dans robots.txt |
| Pages de login / compte | /login, /compte | Noindex + blocage dans robots.txt |
| Pages de recherche interne | /recherche?q=seo | Noindex systématique |
| Fichiers non-HTML | /feed.xml, /favicon.ico | Blocage dans robots.txt (pas de valeur SEO) |
| Pages dupliquées | /seo et /referencement (même contenu) | 301 vers l'une, ou canonical |
Mesurer son crawl budget
Sur un petit site, la mesure est simple :
- Google Search Console → « Statistiques d'indexation » → « Pages » : voir le nombre de pages indexées vs le nombre total de pages du site. Si l'écart est grand, des pages ne sont pas indexées (noindex, 404, non découvertes).
- Log serveur : compter le nombre de requêtes Googlebot sur 24 h. Sur un site de 50 pages, Googlebot devrait visiter 30-50 pages/jour en phase d'indexation initiale, puis 5-15 pages/jour en phase de maintenance.
- Crawl interne : utiliser Screaming Frog (gratuit jusqu'à 500 URLs) pour détecter les 404 internes, les chaînes de redirection et les pages orphelines.
- Bots IA : filtrer les logs sur
GPTBot,PerplexityBot,ClaudeBot. Voir combien de pages ils visitent sur 7 jours. Si ce sont 3 pages sur 50, le maillage vers les pages clés doit être renforcé.
Les 4 erreurs à éviter
| # | Erreur | Conséquence |
|---|---|---|
| 1 | Laisser des pages de test en production | Crawl gaspillé + signal de site « inachevé » |
| 2 | Chaînes de redirection de 3+ hops | Perte d'autorité + crawl 3× plus lent |
| 3 | Pas de canonical sur les URLs avec paramètres | Doublons indexés → dilution de l'autorité |
| 4 | Maillage interne faible (pages clés à 4+ clics) | Les bots IA ne les visitent pas → invisibles sur ChatGPT/Perplexity |
Checklist crawl budget
| # | Point de contrôle | Statut |
|---|---|---|
| 1 | Toutes les pages clés accessibles en ≤ 2 clics depuis la home | ☐ |
| 2 | Pas de pages de test / staging en production | ☐ |
| 3 | Pas de chaîne de redirection > 1 hop (audit Screaming Frog) | ☐ |
| 4 | Pas de 404 internes (liens morts) | ☐ |
| 5 | Canonicals sur toutes les URLs avec paramètres | ☐ |
| 6 | Pages de login / recherche interne en noindex | ☐ |
| 7 | robots.txt : /admin/, /tmp/ bloqués | ☐ |
| 8 | Sitemap XML soumis dans GSC + Bing | ☐ |
| 9 | TTFB < 800 ms (pas de timeout crawler) | ☐ |
| 10 | Log serveur : bots IA visitent ≥ 5 pages / 7 jours | ☐ |
Pour le contexte plus large, voir notre page SEO technique. Pour le maillage interne (action n°1), voir Maillage interne. Pour la vue d'ensemble, voir le guide complet du SEO.
Optimisez votre crawl en 15 minutes
Audit SEO gratuit : nous analysons votre maillage, vos redirections et vos logs de crawl. Vous savez exactement quelles pages le robot visite et lesquelles il ignore.
Demander mon audit gratuit