Guide · technique

Cloudflare, Jetpack, Lovable : les réglages qui bloquent ChatGPT à votre insu

Par Gavin Lancaster, RangIA, Genève. Publié le 21 septembre 2026. Lecture : 7 minutes.

Sur 1'078 sites de PME genevoises testés en septembre 2026, 95 (8,8 %) refusent au moins un robot d'IA. Dans 68 cas sur 79 blocages serveur, le fichier robots.txt du site dit pourtant « autorisé ». Le propriétaire ne le voit pas, son agence non plus, et ChatGPT, Perplexity ou Claude ne lisent jamais la page. Ce guide explique d'où viennent ces blocages, comment vérifier le vôtre en cinq minutes, et quoi régler chez Cloudflare, Jetpack et Lovable.

Ce que nous avons mesuré

RangIA a pris 1'200 sites d'entreprises inscrites au registre du commerce genevois, au hasard, et a demandé la page d'accueil de chacun quatre fois : comme un navigateur, comme GPTBot (OpenAI), comme PerplexityBot et comme ClaudeBot (Anthropic). Nous avons aussi lu le robots.txt de chaque site.

ConstatSitesPart des 1'078 sites joignables
Bloquent au moins un robot d'IA, par n'importe quel moyen958,8 %
Bloquent au niveau du serveur ou du CDN (réponse 403 ou 429)797,3 %
Bloquent par robots.txt (interdiction totale)272,5 %
Blocage serveur alors que robots.txt autorise (blocage silencieux)6886 % des blocages serveur
Sites derrière Cloudflare qui bloquent26 sur 1311 site Cloudflare sur 5

Le chiffre qui compte est le troisième : dans la grande majorité des cas, le blocage ne vient pas d'une décision écrite dans robots.txt. Il vient d'un interrupteur activé par défaut chez l'hébergeur, le CDN ou une extension, que personne n'a regardé.

Le robot le plus souvent refusé est ClaudeBot (58 sites), puis GPTBot (57), puis PerplexityBot (32). Vingt et un sites renvoient un code 429 à GPTBot, c'est-à-dire « trop de requêtes » dès la première visite : un pare-feu qui prend le robot pour une attaque.

Pourquoi c'est un problème, même si vous n'aimez pas l'IA

Un robot d'IA refusé, c'est trois effets distincts.

  1. ChatGPT avec recherche web et Perplexity ne peuvent pas lire votre page au moment où un client pose sa question. Ils citent alors un annuaire, un concurrent ou une page vieille de plusieurs mois. Notre propre site en a fait l'expérience : Perplexity citait encore en septembre 2026 la page d'accueil de juin, parce que rangia.ch a bloqué tous les robots d'IA pendant trois mois sans que nous le sachions.
  2. Les moteurs qui apprennent sur le web (GPTBot, ClaudeBot, Google-Extended) n'incluent pas votre entreprise dans ce qu'ils « savent ». Le jour où quelqu'un demande « qui est [votre entreprise] ? », la réponse vient de LinkedIn ou d'un registre, pas de vous.
  3. Rien ne change pour Google Search : bloquer Google-Extended n'a aucun effet sur le référencement classique ni sur les AI Overviews, qui utilisent Googlebot. Le blocage des IA ne « protège » donc rien d'utile pour une PME de services.

Vérifier votre site en cinq minutes

Trois vérifications, dans cet ordre. Aucun outil payant.

1. Lire votre robots.txt (1 minute)

Ouvrez https://votre-site.ch/robots.txt. Cherchez les lignes User-agent: suivies de GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User, ClaudeBot, Google-Extended, CCBot. Si l'une d'elles est suivie de Disallow: /, ce robot est interdit. Si le fichier commence par un commentaire Cloudflare (« managed robots.txt »), lisez la section suivante.

2. Demander la page comme un robot (2 minutes)

Dans un terminal (macOS, Windows 11, Linux), lancez :

curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; GPTBot/1.2; +https://openai.com/gptbot)" https://votre-site.ch/
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; PerplexityBot/1.0; +https://perplexity.ai/perplexitybot)" https://votre-site.ch/
curl -s -o /dev/null -w "%{http_code}\n" -A "Mozilla/5.0 (compatible; ClaudeBot/1.0; +claudebot@anthropic.com)" https://votre-site.ch/

200 : la page est servie. 403 ou 429 : bloqué au niveau du serveur ou du CDN, quoi que dise robots.txt.

Attention au faux négatif : un 200 obtenu de cette façon ne prouve pas que le vrai robot est servi. Cloudflare et certains hébergeurs vérifient l'adresse IP du robot, pas seulement son nom. Lovable, par exemple, sert une version pré-rendue aux robots dont l'IP est vérifiée et la version JavaScript à tout le monde ; un test avec curl voit la seconde et conclut à tort que rien n'est lisible. Un 403, lui, est une preuve suffisante.

3. Regarder ce que Google et Bing voient réellement (2 minutes)

Dans Search Console, « Inspection de l'URL » puis « Tester l'URL en ligne » montre la page telle que Googlebot la rend, JavaScript compris. Dans Bing Webmaster Tools, l'inspection d'URL fait la même chose pour l'index que ChatGPT utilise. Si les deux voient votre contenu et que curl renvoie 200, vous êtes lisible. Si Google voit la page mais que curl renvoie 403 à GPTBot, vous êtes dans le cas des 68 sites : lisible par Google, invisible pour les IA.

Le scan gratuit RangIA fera ces trois vérifications à votre place et signalera « bloqué » sur une réponse 403, pas seulement sur une ligne de robots.txt.

Ce qu'il faut régler, plateforme par plateforme

Cloudflare : deux interrupteurs

Depuis 2025, Cloudflare propose de bloquer les robots d'IA en un clic et l'active souvent lors de la création d'un nouveau site. Dans notre échantillon, un site Cloudflare sur cinq bloque au moins un robot.

  1. Security → Bots → « Block AI bots » (ou « AI Scrapers and Crawlers ») : passer sur « Allow », ou au minimum autoriser les robots de recherche (OAI-SearchBot, PerplexityBot, ChatGPT-User) tout en bloquant les robots d'entraînement si c'est votre choix.
  2. « Managed robots.txt » : quand cette option est active, Cloudflare réécrit votre robots.txt et y ajoute des interdictions que votre CMS n'a jamais écrites. La désactiver rend le contrôle à votre fichier.

Rangia.ch a eu les deux options actives du 19 juin au 13 septembre 2026. Tous les robots d'IA recevaient « Your request was blocked » avant même d'atteindre le site. Après désactivation, Google est passé de 3 à 5 pages indexées en un jour ; Perplexity, lui, a mis plusieurs semaines à remplacer sa copie de juin.

Jetpack (WordPress.com et WordPress avec Jetpack) : « Training crawlers »

Jetpack a ajouté un onglet GEO dans ses réglages SEO, avec une option « Training crawlers ». Sur un site client de yoga hébergé chez WordPress.com, elle était sur « Block » sans que la propriétaire l'ait choisie, et huit robots d'IA étaient refusés. Réglage : Jetpack → Settings → Traffic (ou SEO) → GEO → Training crawlers → Allow all.

D'autres extensions SEO pour WordPress proposent un interrupteur du même genre dans leur éditeur de robots.txt. Après toute mise à jour d'extension, relisez votre robots.txt : c'est là que ces interrupteurs écrivent.

Lovable et les sites en JavaScript (React, Vue, Webflow avec scripts)

Lovable ne bloque pas les robots d'IA. Le piège est inverse : le contenu n'existe qu'après exécution du JavaScript, et Lovable ne sert la version pré-rendue qu'aux robots dont l'IP est vérifiée. Vos tests avec curl ou avec une extension de navigateur voient une page vide et vous font croire au blocage.

Ce qu'il faut vérifier : Search Console → Inspection de l'URL → « Afficher la page explorée ». Si le titre, la description et les données structurées apparaissent dans le HTML rendu, les moteurs les voient. Ce que nous avons constaté sur un site d'agence genevoise en juillet 2026 : balise canonique identique sur toutes les pages (toutes pointaient vers l'accueil), données structurées uniquement côté client, et toute URL inconnue qui répond 200 avec le titre de l'accueil. Trois défauts invisibles dans le navigateur, tous corrigés par une balise <SEO> par page.

Pare-feu et hébergeurs mutualisés (Apache, nginx, LiteSpeed)

Dans notre échantillon, 45 des 79 blocages serveur ne viennent pas de Cloudflare mais d'Apache, nginx ou LiteSpeed : un module de sécurité (mod_security, fail2ban, listes d'agents « indésirables » copiées de forums) qui refuse tout agent contenant « bot » ou renvoie 429 à la première requête. Demandez à votre hébergeur la liste des user-agents refusés et faites retirer GPTBot, OAI-SearchBot, ChatGPT-User, PerplexityBot, Perplexity-User et ClaudeBot.

Quels robots autoriser, et pourquoi

RobotQuiSert àBloquer a pour effet
OAI-SearchBotOpenAIRecherche ChatGPT (index)Absent des réponses ChatGPT avec recherche web
ChatGPT-UserOpenAILecture d'une page à la demande d'un utilisateurChatGPT ne peut pas lire votre page quand on lui donne le lien
GPTBotOpenAIEntraînement des modèlesLe modèle ne vous « connaît » pas
PerplexityBot, Perplexity-UserPerplexityIndex et lecture à la demandeAbsent de Perplexity
ClaudeBotAnthropicEntraînement et rechercheAbsent de Claude
Google-ExtendedGoogleEntraînement GeminiAucun effet sur Search ni sur les AI Overviews
Applebot-ExtendedAppleEntraînement Apple IntelligenceAucun effet sur Spotlight ou Siri (Applebot classique)
CCBotCommon CrawlArchive ouverte utilisée par de nombreux modèlesAbsent des jeux de données publics

Pour une PME de services, notre recommandation est d'autoriser tout. Si vous tenez à refuser l'entraînement, bloquez GPTBot, ClaudeBot, Google-Extended et CCBot dans robots.txt, mais laissez OAI-SearchBot, ChatGPT-User, PerplexityBot et Perplexity-User : ce sont ceux qui répondent aux clients.

Combien de temps avant que ça se voie

D'après nos propres mesures, après un déblocage :

MoteurDélai observéComment accélérer
Google1 jour pour indexer les pages ajoutées, 5 heures pour une page demandée dans Search ConsoleSearch Console → Inspection → Demander l'indexation
Bing (donc ChatGPT recherche)Quelques joursBing Webmaster Tools + IndexNow
PerplexityPlusieurs semaines : la page de juin était encore citée en septembreAucune commande directe ; publier des pages nouvelles, qui sont récupérées avant les anciennes
ChatGPT sans rechercheAttend une nouvelle version du modèleAucune

En résumé

  1. Lisez votre robots.txt, puis demandez votre page avec curl en vous présentant comme GPTBot, PerplexityBot et ClaudeBot. Un 403 est un blocage certain.
  2. Chez Cloudflare, désactivez « Block AI bots » et « managed robots.txt ». Chez Jetpack, mettez « Training crawlers » sur Allow. Chez un hébergeur mutualisé, demandez la liste des agents refusés.
  3. Sur un site Lovable ou en JavaScript, ne concluez rien avec curl : utilisez l'inspection d'URL de Search Console.
  4. Comptez des jours pour Google et Bing, des semaines pour Perplexity.

Questions fréquentes

Bloquer les robots d'IA protège-t-il mon contenu ?

Pour une PME de services, non : le contenu d'un site vitrine est fait pour être lu, et le blocage ne change rien à Google Search. Il empêche seulement ChatGPT avec recherche web, Perplexity et Claude de vous citer quand un client pose sa question.

Mon robots.txt autorise tout, je suis donc lisible ?

Pas forcément. Dans 68 des 79 blocages serveur mesurés, robots.txt disait « autorisé » alors que le CDN ou le pare-feu renvoyait 403. Le test qui compte est la réponse du serveur au robot, pas le fichier.

Combien de temps après la correction ?

Des jours pour Google et Bing, des semaines pour Perplexity : la moitié des sources citées par les IA ont moins de trois mois, mais le robot doit repasser. Envoyer le sitemap et un ping IndexNow accélère la relecture.

Dernière mise à jour : 21 septembre 2026. Les chiffres cités proviennent des mesures RangIA ; ils décrivent des échantillons datés, pas le marché entier.