AI-crawlers en Franse websites: wie beslist over het antwoord

Voordat een AI-crawler een pagina leest, leest hij een bestand dat zegt wat hij ermee mag doen. Dat bestand bestaat op de meeste websites. Deze meting kijkt naar wat het antwoordt, en vooral naar wie het heeft geschreven.

Gepubliceerd op 3 september 2026 10 301 .fr-websites, gemeten op 3 september 2026

97 %van de websites noemt geen enkele AI-crawler in hun robots.txt
2,2 %weigert er minstens een, door hem te noemen
3,1 %sluit de wortel voor alle crawlers, zoekmachines inbegrepen

Het bestand is er al, het spreekt alleen tegen iemand anders

85,3 % van de gemeten websites publiceert een robots.txt. Dat bestand heeft een geschiedenis: het werd geschreven voor zoekmachines, in een tijd waarin de vraag was welke paginas geïndexeerd zouden worden. De helft van deze bestanden past in één enkele groep instructies, en die groep spreekt iedereen tegelijk aan.

De AI-crawlers lezen hetzelfde bestand en zoeken er hun eigen naam in. Zij vinden die niet op 97 % van de websites. Dat is geen weigering en geen doordachte toestemming: het is een vraag die nog niet is gesteld, in een bestand dat tien jaar ouder is dan zij.

Wat het bestand weigert, crawler voor crawler

Elke crawler heeft zijn eigen groep in een robots.txt, dus een website antwoordt apart aan OpenAI, aan Google en aan Common Crawl. De tabel leest die antwoorden een voor een.

Crawler Beheerd door Wat hij ermee doet Websites die hem weigeren
CCBot Common Crawl Traint een model 2,0 %
GPTBot OpenAI Traint een model 2,0 %
Bytespider ByteDance Traint een model 1,8 %
ClaudeBot Anthropic Traint een model 1,8 %
Google-Extended Google Traint een model 1,8 %
Meta-ExternalAgent Meta Traint een model 1,7 %
Applebot-Extended Apple Traint een model 1,6 %
ChatGPT-User OpenAI Haalt de pagina op wanneer iemand een vraag stelt 0,3 %
PerplexityBot Perplexity Voedt een antwoordmachine 0,1 %
OAI-SearchBot OpenAI Voedt een antwoordmachine 0,1 %

Het verschil is scherp en houdt zichzelf overeind: crawlers die modellen trainen worden door ongeveer 2 % geweigerd, die welke een pagina ophalen om een vraag te beantwoorden twintig keer minder. Het Franse bestand aanvaardt geciteerd te worden en weigert geleerd te worden.

De twee beslissingen zijn niet dezelfde

Training weigeren beschermt inhoud waarvoor een onderneming heeft betaald. Dat is een verdedigbare beslissing, en 2,2 % van de websites heeft haar uitdrukkelijk genomen.

De deur sluiten voor antwoordmachines levert een andere op: uw website houdt op een citeerbare bron te zijn op het precieze moment waarop uw klanten hun vragen aan een AI stellen in plaats van aan een zoekmachine. 3,1 % van de gemeten websites zit in dat geval zonder het gewild te hebben, door een instructie geschreven voor alle crawlers, lang voordat deze bestonden.

Beide beslissingen worden in hetzelfde bestand genomen, in drie regels. Je moet het wel kunnen schrijven.

Op een gesloten platform is dat bestand niet het uwe

Een robots.txt wordt geserveerd door de machine die de website serveert. Wanneer die website op een gesloten platform leeft, is het het platform dat het opstelt, het op al zijn klanten tegelijk toepast en het bijwerkt wanneer het dat beslist.

Wij hebben 2 500 van de bestanden uit de meting herlezen om te zien welke de handtekening van een platformsjabloon droegen. De tabel hieronder geeft wat elk platform voor zijn klanten antwoordt.

Platform Websites in de trekking Groepen instructies
Shopify 57 2
WordPress.com 13 1
Squarespace 11 30
Wix 3 0
Webflow 1 0
Bestand zonder handtekening van een platform 2.410 1

Squarespace serveert zijn klanten een bestand dat een dertigtal crawlers noemt, waaronder alle crawlers uit de tabel hierboven, en er geen enkele weigert. Shopify serveert er een dat er geen enkele noemt. In beide gevallen is het antwoord hetzelfde voor duizenden websites, en de eigenaar van zo een website heeft dat antwoord niet geschreven en heeft ook niet de middelen om het te wijzigen.

Dat onderscheidt een website die men bezit van een website die men bewoont. De vraag van de AI-crawlers kwam in twee jaar; de volgende komt even snel, en zij wordt op dezelfde plek geregeld, in een bestand dat iemand voor u moet kunnen schrijven.

Serenity, in het kort

Serenity is een website die door Simafri wordt gemaakt, gehost, beveiligd en up-to-date gehouden, dat sinds 2002 bedrijfswebsites maakt, host en onderhoudt. De domeinnaam staat op naam van de klant, en een Simafri Suite-account is inbegrepen.

Het aanbod en de tarieven bekijken

Methode

Trekkingskader: de 4 590 553 actieve .fr-domeinen uit het open databestand van Afnic Afnic, fichier des domaines .fr actifs. Daaruit wordt een panel van 15 000 domeinen getrokken, geordend op de sha256-vingerafdruk van elke naam, waardoor iedereen hetzelfde panel kan herbouwen vanaf de gepubliceerde kiem. Het panel blijft van de ene meting op de andere hetzelfde.

Leesketen: op 3 september 2026 serveerden 10 301 van die domeinen een pagina. Voor elk daarvan werd het bestand robots.txt in hetzelfde gesprek opgevraagd. 98 % gaf een vastgesteld beleid terug, dat wil zeggen een leesbaar bestand of een antwoord dat zegt dat er geen is, wat alles toestaat. De cijfers gaan over die.

Wat als weigering telt: een crawler is geweigerd wanneer zijn eigen groep instructies hem de wortel van de website verbiedt. Een groep die alle crawlers tegelijk aanspreekt wordt apart genoteerd, omdat zij over crawlen in het algemeen gaat en niets over AI zegt. Een website waarvan het platform crawlers noemt binnen die algemene groep telt dus niet als een die een beslissing heeft genomen.

Wat niet is gelezen: niets dat toegang vraagt tot de website, tot haar beheer of tot haar hosting. Eén verzoek voor de pagina, één voor het bestand.

Reikwijdte: het panel trekt uit alle actieve .fr-domeinen, ondernemingen, verenigingen en particulieren samen, zonder kwalificatie via een ondernemingsnummer, anders dan onze twee andere metingen. De cijfers beschrijven dus het Franse bestand als geheel. De platformlezing betreft 2 500 websites getrokken onder die welke een bestand serveren.

Bron en hergebruik

De cijfers over het bestand komen uit een openbare index die zijn methode, zijn gedateerde panel en zijn wekelijkse reeks publiceert, gelezen op 3 september 2026. De reeks wordt in JSON geserveerd, crawler voor crawler, en laat zich naspelen.

De index en zijn methode bekijken (Stileex)

JSON-API

Het panel wordt elke week gemeten, wat zal zeggen of het bestand op deze vraag beweegt en in welke richting.

Weer zeggenschap over wat uw website antwoordt

Simafri is sinds 2002 de technische bondgenoot van uw onderneming: wij maken uw website, hosten hem, onderhouden hem en houden hem up-to-date, met uw domeinnaam op uw naam. U beslist wie van uw paginas mag leren en wie ze mag citeren, wij doen het werk. Schrijf ons, we bekijken uw geval samen.