llms.txt et sites français : qui a déjà posé le fichier

Le llms.txt est une invitation faite aux assistants d'IA : un fichier court, à la racine du site, qui dit ce qu'on est et où regarder. Ce relevé compte ceux qui l'ont posé, et lit ce qu'ils disent aux mêmes robots dans le fichier d'à côté.

Publié le 5 septembre 2026 Panier de 15 000 domaines .fr, relevé le 4 septembre 2026

7,9 %des sites .fr qui répondent servent un vrai llms.txt
3 878octets, la taille médiane du fichier servi
2,8 %de ceux qui le publient refusent par ailleurs un robot d'IA

Ce que le fichier fait, et pourquoi il apparaît maintenant

Un llms.txt est un fichier Markdown posé à /llms.txt. Il présente le site en quelques lignes et pointe vers les pages qui comptent, pour qu'un assistant d'IA les lise directement au lieu de reconstituer un site entier. Le format tient en une exigence : un titre de niveau 1 en tête, le reste est libre.

Il répond à une question neuve. Un moteur de recherche explore un site page par page et classe ce qu'il trouve ; un assistant, lui, lit vite, cite peu, et a besoin qu'on lui dise où est l'essentiel. 7,9 % des sites .fr qui répondent ont déjà pris position sur cette question, deux ans après que le format a été proposé.

Répondre 200 ne veut pas dire avoir le fichier

C'est le piège de ce relevé, et il change tout : beaucoup de sites renvoient leur page d'accueil sur n'importe quelle adresse inconnue. Demander /llms.txt à un tel site rend un code 200 et une page HTML, jamais un llms.txt. Un comptage qui s'arrête au code HTTP additionne donc les deux premières lignes du tableau et publie une adoption cinq fois trop haute.

Ce que le site répond à /llms.txt Part des sites
Un fichier qui s'ouvre sur un titre Markdown 7,9 %
Un code 200, mais autre chose (le plus souvent l'accueil) 36,6 %
Une réponse disant que le fichier n'existe pas 55,5 %

Le relevé lit le corps de la réponse et ne compte comme llms.txt que ce qui s'ouvre sur un titre de niveau 1, le seul élément que le format exige.

Deux fichiers, deux mains, deux réponses

Un site qui pose un llms.txt invite les assistants d'IA à venir lire. Le fichier robots.txt, à trois lignes de là, dit à ces mêmes robots s'ils ont le droit d'entrer. Les deux se lisent le même matin, sur le même domaine.

Parmi les sites qui publient un llms.txt, 2,8 % interdisent par ailleurs leur racine à au moins un robot d'IA. Sur l'ensemble du parc .fr, cette part est de 2,2 %. Autrement dit, poser l'invitation ne va pas avec ouvrir la porte : les sites qui invitent refusent un peu plus souvent que les autres.

Rien là-dedans n'est contradictoire en soi : refuser l'entraînement d'un modèle et vouloir être bien lu par un assistant sont deux décisions distinctes, et elles peuvent parfaitement cohabiter. Ce que le chiffre montre, c'est que ces deux fichiers sont rarement écrits ensemble, alors qu'ils répondent au même interlocuteur.

Un fichier court, qui se tient à jour

La taille médiane est de 3 878 octets, soit à peu près quatre kilo-octets : une page de plan, pas une copie du site. C'est cohérent avec ce que le format demande, et c'est aussi ce qui le rend tenable dans le temps.

Un llms.txt vaut ce que vaut sa fraîcheur. Il nomme des pages, et une page qui change d'adresse laisse dans le fichier une ligne qui ne mène plus nulle part. C'est un fichier à reprendre à chaque refonte, au même titre qu'un plan de site.

Serenity, en clair

Serenity est un site web créé, hébergé, sécurisé et tenu à jour par Simafri, qui crée, héberge et maintient les sites d'entreprises depuis 2002. Le nom de domaine est déposé au nom du client, et un compte Simafri Suite est inclus.

Voir l'offre et les tarifs

Méthode

Cadre de tirage : les 4 590 553 domaines .fr actifs du fichier open data de l'Afnic Afnic, fichier des domaines .fr actifs. Un panier de 15 000 domaines y est tiré au sort, classé par l'empreinte sha256 de chaque nom, ce qui permet à n'importe qui de rebâtir le même panier à partir de la graine publiée. Le panier reste le même d'un relevé à l'autre, donc un mouvement de la série est une décision du parc.

Chaîne de lecture : le /llms.txt est demandé une fois par semaine, dans le même passage qui ouvre déjà chaque domaine du panier. Les chiffres portent sur les sites qui répondent à la question, soit 98 % de ceux qui servent une page : ceux qui servent un fichier, ceux qui servent autre chose, et ceux qui répondent que le fichier n'existe pas.

Ce qui compte comme un llms.txt : un corps qui s'ouvre sur un titre Markdown de niveau 1. La taille publiée est la médiane des fichiers servis, en octets. Le robots.txt est lu sur le même domaine et le même matin, et un robot d'IA est compté comme refusé quand son propre groupe de consignes lui interdit la racine.

Ce qui n'a pas été lu : rien qui demande un accès au site, à son administration ou à son hébergement. Une requête pour la page, une pour chaque fichier.

Portée : le panier tire dans l'ensemble des domaines .fr actifs, entreprises, associations et particuliers confondus, sans qualification par le SIREN. Les chiffres décrivent donc le parc français dans son ensemble, et la part des sites qui refusent un robot d'IA est celle du même relevé hebdomadaire.

Source et réutilisation

Les chiffres viennent d'un indice public qui publie sa méthode, son panier daté et sa série hebdomadaire, relevé du 4 septembre 2026. La série est servie en JSON et se rejoue.

Voir l'indice et sa méthode (Stileex)

API JSON

Le panier est relevé chaque semaine, ce qui dira à quelle vitesse le parc pose ce fichier, et si ceux qui le posent ouvrent aussi leur porte.

Poser votre llms.txt, et le tenir

Simafri est l'allié technique de votre entreprise depuis 2002 : nous créons votre site, l'hébergeons, le maintenons et le tenons à jour, avec votre nom de domaine déposé à votre nom. Votre llms.txt et votre robots.txt disent ce que vous avez décidé, et sont repris quand vos pages bougent. Écrivez-nous, on regarde votre cas ensemble.