Robots d'IA et sites français : qui décide de la réponse

Avant de lire une page, un robot d'IA lit un fichier qui dit ce qu'il a le droit d'en faire. Ce fichier existe sur la plupart des sites. Ce relevé regarde ce qu'il répond, et surtout qui l'a écrit.

Publié le 3 septembre 2026 10 301 sites .fr, relevés le 3 septembre 2026

97 %des sites ne nomment aucun robot d'IA dans leur robots.txt
2,2 %en refusent au moins un, en le nommant
3,1 %ferment leur racine à tous les robots, moteurs de recherche compris

Le fichier est déjà là, il parle simplement à quelqu'un d'autre

85,3 % des sites relevés publient un robots.txt. Ce fichier a une histoire : il a été écrit pour les moteurs de recherche, à une époque où la question était de savoir quelles pages seraient indexées. La moitié de ces fichiers tient en un seul groupe de consignes, et ce groupe s'adresse à tout le monde à la fois.

Les robots d'IA, eux, lisent le même fichier et y cherchent leur propre nom. Ils ne le trouvent pas sur 97 % des sites. Ce n'est pas un refus, ce n'est pas une autorisation réfléchie : c'est une question qui n'a pas encore été posée, sur un fichier qui a dix ans de plus qu'elle.

Ce que le parc refuse, robot par robot

Chaque robot a son propre groupe dans un robots.txt, donc un site répond séparément à OpenAI, à Google et à Common Crawl. Le tableau lit ces réponses une par une.

Robot Opéré par Ce qu'il en fait Sites qui le refusent
CCBot Common Crawl Entraîne un modèle 2,0 %
GPTBot OpenAI Entraîne un modèle 2,0 %
Bytespider ByteDance Entraîne un modèle 1,8 %
ClaudeBot Anthropic Entraîne un modèle 1,8 %
Google-Extended Google Entraîne un modèle 1,8 %
Meta-ExternalAgent Meta Entraîne un modèle 1,7 %
Applebot-Extended Apple Entraîne un modèle 1,6 %
ChatGPT-User OpenAI Va lire la page quand quelqu'un pose la question 0,3 %
PerplexityBot Perplexity Alimente un moteur de réponse 0,1 %
OAI-SearchBot OpenAI Alimente un moteur de réponse 0,1 %

L'écart est net et il tient debout tout seul : les robots qui entraînent des modèles sont refusés autour de 2 %, ceux qui vont chercher une page pour répondre à une question le sont vingt fois moins. Le parc français accepte d'être cité et refuse d'être appris.

Les deux décisions ne sont pas la même

Refuser l'entraînement protège un contenu qu'une entreprise a payé pour produire. C'est une décision défendable, et 2,2 % des sites l'ont prise explicitement.

Fermer la porte aux moteurs de réponse en produit une autre : votre site cesse d'être une source citable au moment précis où vos clients posent leurs questions à une IA plutôt qu'à un moteur de recherche. 3,1 % des sites relevés sont dans ce cas sans l'avoir voulu, par une consigne écrite pour tous les robots, bien avant que ces robots existent.

Les deux décisions se prennent dans le même fichier, en trois lignes. Encore faut-il pouvoir l'écrire.

Sur une plateforme fermée, ce fichier n'est pas le vôtre

Un robots.txt est servi par la machine qui sert le site. Quand ce site vit sur une plateforme fermée, c'est la plateforme qui le rédige, l'applique à tous ses clients à la fois, et le met à jour quand elle le décide.

Nous avons relu 2 500 des fichiers du relevé pour voir lesquels portaient la signature d'un gabarit de plateforme. Le tableau ci-dessous donne ce que chacune répond pour ses clients.

Plateforme Sites du tirage Groupes de consignes
Shopify 57 2
WordPress.com 13 1
Squarespace 11 30
Wix 3 0
Webflow 1 0
Fichier sans signature de plateforme 2 410 1

Squarespace sert à ses clients un fichier qui nomme une trentaine de robots, dont tous ceux du tableau plus haut, et n'en refuse aucun. Shopify en sert un qui n'en nomme aucun. Dans les deux cas la réponse est la même pour des milliers de sites, et le propriétaire d'un de ces sites n'a ni écrit cette réponse ni les moyens de la changer.

C'est ce qui distingue un site qu'on possède d'un site qu'on occupe. La question des robots d'IA est arrivée en deux ans ; la suivante arrivera aussi vite, et elle se réglera au même endroit, dans un fichier que quelqu'un doit pouvoir écrire pour vous.

Serenity, en clair

Serenity est un site web créé, hébergé, sécurisé et tenu à jour par Simafri, qui crée, héberge et maintient les sites d'entreprises depuis 2002. Le nom de domaine est déposé au nom du client, et un compte Simafri Suite est inclus.

Voir l'offre et les tarifs

Méthode

Cadre de tirage : les 4 590 553 domaines .fr actifs du fichier open data de l'Afnic Afnic, fichier des domaines .fr actifs. Un panier de 15 000 domaines y est tiré au sort, classé par l'empreinte sha256 de chaque nom, ce qui permet à n'importe qui de rebâtir le même panier à partir de la graine publiée. Le panier reste le même d'un relevé à l'autre.

Chaîne de lecture : le 3 septembre 2026, 10 301 de ces domaines ont servi une page. Pour chacun, le fichier robots.txt a été demandé dans la même conversation. 98 % ont rendu une politique établie, c'est-à-dire un fichier lisible ou une réponse disant qu'il n'y en a pas, ce qui autorise tout. Les chiffres portent sur ceux-là.

Ce qui compte comme un refus : un robot est refusé quand son propre groupe de consignes lui interdit la racine du site. Un groupe qui vise tous les robots à la fois est relevé à part, parce qu'il porte sur le crawl en général et ne dit rien de l'IA. Un site dont la plateforme nomme des robots dans ce groupe général n'est donc pas compté comme ayant pris une décision.

Ce qui n'a pas été lu : rien qui demande un accès au site, à son administration ou à son hébergement. Une requête pour la page, une pour le fichier.

Portée : le panier tire dans l'ensemble des domaines .fr actifs, entreprises, associations et particuliers confondus, sans qualification par le SIREN, à la différence de nos deux autres relevés. Les chiffres décrivent donc le parc français dans son ensemble. Le relevé des plateformes porte sur 2 500 sites tirés parmi ceux qui servent un fichier.

Source et réutilisation

Les chiffres du parc viennent d'un indice public qui publie sa méthode, son panier daté et sa série hebdomadaire, relevé du 3 septembre 2026. La série est servie en JSON, robot par robot, et se rejoue.

Voir l'indice et sa méthode (Stileex)

API JSON

Le panier est relevé chaque semaine, ce qui dira si le parc bouge sur cette question et dans quel sens.

Reprendre la main sur ce que votre site répond

Simafri est l'allié technique de votre entreprise depuis 2002 : nous créons votre site, l'hébergeons, le maintenons et le tenons à jour, avec votre nom de domaine déposé à votre nom. Vous décidez qui peut apprendre de vos pages et qui peut les citer, nous faisons le geste. Écrivez-nous, on regarde votre cas ensemble.