robots.txt : guide complet pour ne pas bloquer les mauvais robots YperLine

Syntaxe, bots IA à autoriser (GPTBot, PerplexityBot, ClaudeBot, Google-Extended), 6 règles d'or, exemples concrets et les 5 erreurs qui coûtent cher.


robots.txt : guide complet pour ne pas bloquer les mauvais robots

Qu'est-ce que robots.txt ?

Le fichier robots.txt est un fichier texte placé à la racine du site (/robots.txt) qui indique aux robots de crawl quelles pages et dossiers ils peuvent ou non consulter. C'est le premier fichier lu par tout crawler avant d'explorer le site. Une erreur de configuration peut bloquer l'indexation de l'intégralité du site — ou, à l'inverse, autoriser des bots indésirables.

Contrairement au noindex (qui demande à Google de ne pas indexer une page qu'il a déjà lue), robots.txt empêche le robot de lire la page. Si une page est bloquée dans robots.txt, Google ne peut pas voir la balise noindex qu'elle contient — paradoxalement, elle peut rester indexée si elle est découverte via un lien externe.

Syntaxe et directives

Les 3 directives

DirectiveRôleExemple
User-agentIdentifie le robot concernéUser-agent: * (tous les robots)
AllowAutorise l'accès à un cheminAllow: /
DisallowInterdit l'accès à un cheminDisallow: /admin/

Directives supplémentaires

DirectiveRôle
Crawl-delayRetard entre 2 requêtes (seul Bingbot et quelques bots l'honorent)
SitemapRéférence le sitemap XML (facilite la découverte)
HostDomaine principal (reconnu uniquement par Yandex)

Ordre de priorité

  1. La directive la plus spécifique l'emporte (ex. Disallow: /admin/secrets/ bat Allow: /admin/).
  2. Si aucune directive ne matche, l'accès est autorisé par défaut.
  3. Un User-agent: nom-specifique bat un User-agent: * pour ce robot.

Les bots IA à autoriser (2026)

Pour le GEO, il est essentiel d'autoriser les crawlers des moteurs IA. Voici la liste complète des user-agents à connaître :

User-AgentÉditeurRôleÀ autoriser ?
GPTBotOpenAIIndexation pour ChatGPT SearchOui
ChatGPT-UserOpenAIBrowsing en temps réel (mode recherche)Oui
PerplexityBotPerplexity AICrawl pour l'index PerplexityOui
ClaudeBotAnthropicIndexation pour ClaudeOui
Google-ExtendedGoogleEntraînement Gemini / IA GoogleOui
GooglebotGoogleIndex Google standardOui (obligatoire)
bingbotMicrosoftIndex Bing (utilisé par Copilot + ChatGPT)Oui
MicrosoftPreviewMicrosoftFonctionnalités IA MicrosoftOui
CCBotCommon CrawlDataset open source (source de nombreux LLMs)Oui (recommandé)
AmazonbotAmazonIndexation pour Alexa / AWSOptionnel

Par défaut : si votre robots.txt ne mentionne pas un bot, il est autorisé (à condition de ne pas avoir de User-agent: * avec Disallow: /). Le problème n'est pas d'oublier d'autoriser, c'est de bloquer par inadvertance.

Les 6 règles d'or

#RèglePourquoi
1Jamais de Disallow: / globalBloque tout le site pour tous les robots → invisible sur Google et les IA
2Referencer le sitemapSitemap: https://yperline.net/sitemap.xml → découverte accélérée
3Bloquer uniquement l'admin et le temporaire/admin/, /tmp/, /wp-admin/ — pas le contenu
4Ne pas bloquer les bots IAUn Disallow: / sous User-agent: GPTBot = invisible sur ChatGPT
5Ne pas utiliser robots.txt pour le noindexBloquer une page = le robot ne peut pas lire le noindex → la page reste indexée
6Tester avant de modifierUn robots.txt invalide (erreur de syntaxe) est ignoré → les robots crawlent tout, ou rien selon l'implémentation

Exemples concrets

robots.txt minimal (recommandé pour YperLine)

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /tmp/

Sitemap: https://yperline.net/sitemap.xml

robots.txt avec blocage sélectif

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /tmp/
Disallow: /images/
Disallow: /assets/

# Bloquer un seul bot spécifique (ex. un bot de scraping agressif)
User-agent: BadBot
Disallow: /

Sitemap: https://yperline.net/sitemap.xml

robots.txt avec autorisation explicite des bots IA (défensive)

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /tmp/

# Autorisation explicite (redondante si pas de Disallow global, mais sécurise)
User-agent: GPTBot
Allow: /

User-agent: ChatGPT-User
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: Google-Extended
Allow: /

User-agent: MicrosoftPreview
Allow: /

Sitemap: https://yperline.net/sitemap.xml

Note : l'autorisation explicite est redondante si vous n'avez pas de Disallow: / global. Elle est utile comme documentation et comme filet de sécurité si quelqu'un ajoute un Disallow: / par erreur dans le futur.

Les 5 erreurs qui coûtent cher

#ErreurConséquenceCorrection
1User-agent: * Disallow: /Site invisible sur tous les moteursRemplacer par Allow: /
2Bloquer /images/ ou /css/Google ne peut pas analyser le rendu visuel → perte de signalNe bloquer que les dossiers non nécessaires au contenu
3Bloquer GPTBot ou PerplexityBotInvisible sur ChatGPT et Perplexity → zéro citation GEOSupprimer le Disallow ou ajouter un Allow explicite
4Utiliser robots.txt pour masquer une page sensibleLa page reste indexée (le robot ne lit pas le noindex)Utiliser <meta name="robots" content="noindex"> dans le HTML
5Erreur de syntaxe (espace manquant, faute de frappe)Fichier ignoré par certains robots → comportement imprévisibleValider avec l'outil de test GSC

Vérifier son robots.txt

  1. Accès direct : taper https://yperline.net/robots.txt dans le navigateur. Le fichier doit s'afficher en texte brut (content-type text/plain).
  2. Google Search Console → « Paramètres » → « Robots.txt Tester » : coller une URL et vérifier si elle est autorisée ou bloquée.
  3. Log serveur : vérifier que les bots IA visitent le site. Filtrer les logs sur GPTBot, PerplexityBot, Google-Extended. Si aucune requête dans les 7 derniers jours, soit le bot ne vous a pas encore visité, soit il est bloqué.
  4. Test inversé : sur Perplexity, taper le nom de votre marque. Si des pages apparaissent, le bot a bien crawlé.

Checklist robots.txt

#Point de contrôleStatut
1Fichier accessible à /robots.txt (HTTP 200)☐
2Pas de Disallow: / global☐
3Googlebot autorisé (pas de Disallow spécifique)☐
4GPTBot + ChatGPT-User autorisés☐
5PerplexityBot autorisé☐
6ClaudeBot autorisé☐
7Google-Extended autorisé☐
8bingbot + MicrosoftPreview autorisés☐
9Sitemap référencé (Sitemap: https://…)☐
10Seuls /admin/ et /tmp/ sont bloqués☐
11Validé dans GSC (outil de test robots.txt)☐
12Log serveur : bots IA visibles dans les 7 derniers jours☐

Pour le sitemap (complémentaire), voir Sitemap XML : guide complet. Pour le GEO (pourquoi les bots IA comptent), voir Guide GEO. Pour la vue d'ensemble du SEO technique, voir SEO technique.

Vérifiez que vos bots IA ne sont pas bloqués

Audit SEO gratuit : nous analysons votre robots.txt, votre sitemap et vos logs de crawl. Vous savez en 15 minutes si ChatGPT, Perplexity et Gemini peuvent lire votre site.

Demander mon audit gratuit