418 DevOps Votre spécialiste sérénité informatique

Étude · publiée le

Étude GEO 2026 : les sites des entreprises alsaciennes sont-ils visibles par les IA ?

En septembre 2026, j'ai passé cent sites d'entreprises alsaciennes, tirés au sort, dans les mêmes contrôles que mon mini-audit GEO. Première surprise : presque aucune ne ferme volontairement la porte aux IA. La seconde est moins rassurante : environ une sur dix leur est peut-être invisible, sans le savoir.

Le robots.txt n'est pas le problème

Sur les 84 sites analysables, deux seulement interdisent un robot de recherche d'IA dans leur fichier robots.txt, et aucun ne les interdit tous. Trois refusent un robot d'entraînement. Contrairement à une idée répandue, les petites entreprises alsaciennes ne se ferment pas aux IA par choix.

Le pare-feu, si

Quand on redemande la page d'accueil en se présentant comme un robot d'IA, onze sites refusent au moins une fois, soit 13 %. Neuf d'entre eux refusent un robot qui sert à citer les sites dans les réponses, celui de ChatGPT ou celui de Perplexity : ils ont de bonnes chances d'être absents de ces réponses.

Deux de ces onze sites seulement passent par Cloudflare. Les autres refus viennent donc d'autres dispositifs de sécurité, que l'étude ne permet pas d'identifier précisément : protection de l'hébergeur, extension de sécurité, règles du serveur. Dans tous les cas, le propriétaire du site n'a probablement jamais pris cette décision.

Ce chiffre est un maximum : certains pare-feu vérifient l'adresse des vrais robots et refusent une imitation qu'ils laisseraient passer. Mais même divisé par deux, il reste bien au-dessus des blocages volontaires.

Qui êtes-vous, pour une IA ?

40 % des sites ne contiennent aucune donnée structurée, ces informations lisibles par les machines qui indiquent le nom de l'entreprise, son adresse, son activité. Les 40 % qui en déclarent une font déjà ce travail. Pour une IA qui doit décider qui citer, c'est la différence entre une entreprise identifiée et une page parmi d'autres.

Autres constats : 80 % ont un sitemap, 7 % ne sont toujours pas en HTTPS, et 11 % proposent déjà un fichier llms.txt, plus qu'on ne l'imaginerait. Bonne nouvelle en revanche, deux sites seulement affichent une page d'accueil quasi vide sans JavaScript.

Les chiffres

ConstatSitesPart
Bloquent au moins un robot de recherche IA dans leur robots.txt22 %
Bloquent tous les robots de recherche IA testés00 %
Bloquent au moins un robot d'entraînement dans leur robots.txt34 %
Refusent au moins un robot d'IA au niveau du pare-feu1113 %
dont sites servis par Cloudflare22 %
Probablement absents des réponses de ChatGPT ou de Perplexity911 %
N'ont pas de robots.txt1315 %
Page d'accueil quasi vide sans JavaScript22 %
N'ont aucune donnée structurée3440 %
Déclarent leur entreprise en données structurées3440 %
Ont un sitemap6780 %
Ont un fichier llms.txt911 %
Ne sont pas en HTTPS67 %

Sur 84 sites, un pourcentage autour de 20 % n'est connu qu'à environ 9 points près. Un résultat nul signifie seulement que la part réelle est probablement inférieure à 3,6 %. Ces chiffres donnent des ordres de grandeur, pas des décimales.

Vérifier votre propre site

  • Passez-le dans le mini-audit GEO : il fait les mêmes contrôles, en quelques secondes.
  • Si vous êtes à l'aise avec un terminal, la commande curl -I -A "OAI-SearchBot" https://votre-site.fr/ doit renvoyer un code 200. Un code 403 signale un blocage.
  • Demandez à votre hébergeur si sa protection contre les robots filtre les robots d'IA, et lesquels.
  • Décidez robot par robot : on peut refuser l'entraînement des modèles tout en restant citable dans les réponses. La page SEO technique et GEO explique la différence.

Méthode

  • Échantillon : cent entreprises du Bas-Rhin et du Haut-Rhin (bureaux, artisans, commerces) déclarant un site web dans OpenStreetMap, tirées au sort parmi 2 392 candidates, hors réseaux sociaux et hors chaînes présentes à trois adresses ou plus. Seize sites étaient injoignables ou en erreur ; 84 ont été analysés. Données © contributeurs OpenStreetMap, licence ODbL.
  • robots.txt interprété selon la RFC 9309, pour la page d'accueil. Robots de recherche : OAI-SearchBot, ChatGPT-User, Claude-SearchBot, Claude-User, PerplexityBot. Robots d'entraînement : GPTBot, ClaudeBot, Google-Extended, Applebot-Extended, CCBot.
  • Pare-feu : page d'accueil redemandée en se présentant comme GPTBot, OAI-SearchBot, ClaudeBot et PerplexityBot. Seul un refus explicite (401, 403, 406 ou page de vérification) compte comme blocage ; les réponses instables sont retentées puis écartées.
  • Page quasi vide sans JavaScript : moins de 50 mots visibles dans le HTML brut alors que la page charge des scripts.
  • Relevé du 24 septembre 2026. Aucun site n'est nommé.

L'étude sera refaite chaque semestre. Prochaine édition au printemps 2027.

Questions fréquentes

Questions sur l'étude

Comment savoir si mon site est visible par ChatGPT ?

Vérifiez que son robots.txt n'interdit pas OAI-SearchBot, et que votre pare-feu ne le refuse pas. Le mini-audit GEO gratuit contrôle ces deux points en quelques secondes.

Mon hébergeur peut-il bloquer les IA sans me le dire ?

Oui. Les protections contre les robots peuvent filtrer aussi les robots d'IA, parfois par défaut. Dans cette étude, la grande majorité des refus ne venait pas d'une règle écrite dans le robots.txt du site.

Pourquoi ne pas nommer les sites ?

Parce que l'objectif est de mesurer une situation, pas de pointer des entreprises qui n'ont souvent jamais choisi ces réglages.

Votre site fait-il partie des 13 % ?

Le mini-audit GEO vous le dit en quelques secondes. S'il trouve un blocage, je peux vous aider à le lever sans affaiblir votre sécurité.