KI-Crawler und französische Websites: wer die Antwort entscheidet

Bevor ein KI-Crawler eine Seite liest, liest er eine Datei, die sagt, was er damit tun darf. Diese Datei gibt es auf den meisten Websites. Diese Erhebung betrachtet, was sie antwortet, und vor allem, wer sie geschrieben hat.

Veröffentlicht am 3. September 2026 10 301 .fr-Websites, erhoben am 3. September 2026

97 %der Websites nennen keinen KI-Crawler in ihrer robots.txt
2,2 %weisen mindestens einen ab, indem sie ihn nennen
3,1 %schließen ihre Wurzel für alle Crawler, Suchmaschinen eingeschlossen

Die Datei ist längst da, sie spricht nur mit jemand anderem

85,3 % der erhobenen Websites veröffentlichen eine robots.txt. Diese Datei hat eine Geschichte: sie wurde für Suchmaschinen geschrieben, zu einer Zeit, als die Frage lautete, welche Seiten indexiert würden. Die Hälfte dieser Dateien besteht aus einer einzigen Gruppe von Regeln, und diese Gruppe spricht alle zugleich an.

Die KI-Crawler lesen dieselbe Datei und suchen darin ihren eigenen Namen. Auf 97 % der Websites finden sie ihn nicht. Das ist keine Ablehnung und keine überlegte Erlaubnis: es ist eine Frage, die noch nicht gestellt wurde, in einer Datei, die zehn Jahre älter ist als sie.

Was der Bestand abweist, Crawler für Crawler

Jeder Crawler hat seine eigene Gruppe in einer robots.txt, eine Website antwortet OpenAI, Google und Common Crawl also getrennt. Die Tabelle liest diese Antworten einzeln.

Crawler Betrieben von Was er mit der Seite tut Websites, die ihn abweisen
CCBot Common Crawl Trainiert ein Modell 2,0 %
GPTBot OpenAI Trainiert ein Modell 2,0 %
Bytespider ByteDance Trainiert ein Modell 1,8 %
ClaudeBot Anthropic Trainiert ein Modell 1,8 %
Google-Extended Google Trainiert ein Modell 1,8 %
Meta-ExternalAgent Meta Trainiert ein Modell 1,7 %
Applebot-Extended Apple Trainiert ein Modell 1,6 %
ChatGPT-User OpenAI Holt die Seite, wenn jemand eine Frage stellt 0,3 %
PerplexityBot Perplexity Speist eine Antwortmaschine 0,1 %
OAI-SearchBot OpenAI Speist eine Antwortmaschine 0,1 %

Der Abstand ist deutlich und trägt sich selbst: Crawler, die Modelle trainieren, werden von rund 2 % abgewiesen, jene, die eine Seite holen, um eine Frage zu beantworten, zwanzigmal seltener. Der französische Bestand nimmt an, zitiert zu werden, und lehnt ab, gelernt zu werden.

Die beiden Entscheidungen sind nicht dieselbe

Das Training abzulehnen schützt Inhalte, für deren Erstellung ein Unternehmen bezahlt hat. Das ist eine vertretbare Entscheidung, und 2,2 % der Websites haben sie ausdrücklich getroffen.

Die Tür vor Antwortmaschinen zu schließen bringt eine andere hervor: Ihre Website hört genau in dem Moment auf, eine zitierbare Quelle zu sein, in dem Ihre Kundschaft ihre Fragen einer KI statt einer Suchmaschine stellt. 3,1 % der erhobenen Websites sind in dieser Lage, ohne es gewollt zu haben, durch eine Regel, die für alle Crawler geschrieben wurde, lange bevor es diese gab.

Beide Entscheidungen werden in derselben Datei getroffen, in drei Zeilen. Man muss sie nur schreiben können.

Auf einer geschlossenen Plattform gehört diese Datei nicht Ihnen

Eine robots.txt wird von der Maschine ausgeliefert, die die Website ausliefert. Lebt diese Website auf einer geschlossenen Plattform, schreibt die Plattform die Datei, wendet sie auf alle ihre Kunden zugleich an und aktualisiert sie, wann sie es entscheidet.

Wir haben 2 500 der Dateien aus der Erhebung erneut gelesen, um zu sehen, welche die Signatur einer Plattformvorlage tragen. Die Tabelle unten zeigt, was jede von ihnen für ihre Kunden antwortet.

Plattform Websites der Ziehung Regelgruppen
Shopify 57 2
WordPress.com 13 1
Squarespace 11 30
Wix 3 0
Webflow 1 0
Datei ohne Plattformsignatur 2.410 1

Squarespace liefert seinen Kunden eine Datei, die rund dreißig Crawler nennt, darunter alle aus der Tabelle oben, und keinen einzigen abweist. Shopify liefert eine, die keinen nennt. In beiden Fällen ist die Antwort für Tausende Websites dieselbe, und die Inhaberin einer dieser Websites hat diese Antwort weder geschrieben noch die Mittel, sie zu ändern.

Das unterscheidet eine Website, die man besitzt, von einer, die man bewohnt. Die Frage der KI-Crawler kam in zwei Jahren; die nächste kommt genauso schnell, und sie wird an derselben Stelle geregelt, in einer Datei, die jemand für Sie schreiben können muss.

Serenity, klar gesagt

Serenity ist eine Website, erstellt, gehostet, abgesichert und aktuell gehalten von Simafri, das seit 2002 Unternehmenswebsites erstellt, hostet und pflegt. Der Domainname wird auf den Namen der Kundin eingetragen, und ein Simafri-Suite-Konto ist enthalten.

Angebot und Preise ansehen

Methode

Ziehungsrahmen: die 4 590 553 aktiven .fr-Domains aus der offenen Datendatei von Afnic Afnic, fichier des domaines .fr actifs. Daraus wird ein Panel von 15 000 Domains gezogen, geordnet nach dem sha256-Fingerabdruck jedes Namens, sodass jede und jeder aus dem veröffentlichten Startwert dasselbe Panel neu aufbauen kann. Das Panel bleibt von einer Erhebung zur nächsten dasselbe.

Lesekette: am 3. September 2026 lieferten 10 301 dieser Domains eine Seite aus. Für jede wurde die Datei robots.txt in derselben Verbindung angefragt. 98 % gaben eine geklärte Haltung zurück, also eine lesbare Datei oder eine Antwort, die besagt, dass es keine gibt, was alles erlaubt. Die Zahlen beziehen sich auf diese.

Was als Ablehnung zählt: ein Crawler ist abgewiesen, wenn seine eigene Regelgruppe ihm die Wurzel der Website verbietet. Eine Gruppe, die alle Crawler zugleich anspricht, wird gesondert erfasst, weil sie das Crawlen im Allgemeinen betrifft und nichts über KI sagt. Eine Website, deren Plattform Crawler in dieser allgemeinen Gruppe nennt, gilt daher nicht als eine, die entschieden hat.

Was nicht gelesen wurde: nichts, was Zugang zur Website, zu ihrer Verwaltung oder zu ihrem Hosting verlangt. Eine Anfrage für die Seite, eine für die Datei.

Reichweite: das Panel zieht aus allen aktiven .fr-Domains, Unternehmen, Vereine und Privatpersonen zusammen, ohne Qualifizierung über die Unternehmensnummer, anders als bei unseren beiden anderen Erhebungen. Die Zahlen beschreiben also den französischen Bestand als Ganzes. Die Plattformlesung umfasst 2 500 Websites, gezogen unter jenen, die eine Datei ausliefern.

Quelle und Weiterverwendung

Die Zahlen zum Bestand stammen aus einem öffentlichen Index, der seine Methode, sein datiertes Panel und seine wöchentliche Reihe veröffentlicht, gelesen am 3. September 2026. Die Reihe wird als JSON ausgeliefert, Crawler für Crawler, und lässt sich nachspielen.

Index und Methode ansehen (Stileex)

JSON-API

Das Panel wird jede Woche erhoben, was zeigen wird, ob sich der Bestand in dieser Frage bewegt und in welche Richtung.

Die Antwort Ihrer Website wieder selbst bestimmen

Simafri ist seit 2002 der technische Verbündete Ihres Unternehmens: wir erstellen Ihre Website, hosten sie, pflegen sie und halten sie aktuell, mit Ihrem Domainnamen auf Ihren Namen eingetragen. Sie entscheiden, wer aus Ihren Seiten lernen und wer sie zitieren darf, wir machen den Handgriff. Schreiben Sie uns, wir sehen uns Ihren Fall gemeinsam an.