Bevor ein KI-Crawler eine Seite liest, liest er eine Datei, die sagt, was er damit tun darf. Diese Datei gibt es auf den meisten Websites. Diese Erhebung betrachtet, was sie antwortet, und vor allem, wer sie geschrieben hat.
85,3 % der erhobenen Websites veröffentlichen eine robots.txt. Diese Datei hat eine Geschichte: sie wurde für Suchmaschinen geschrieben, zu einer Zeit, als die Frage lautete, welche Seiten indexiert würden. Die Hälfte dieser Dateien besteht aus einer einzigen Gruppe von Regeln, und diese Gruppe spricht alle zugleich an.
Die KI-Crawler lesen dieselbe Datei und suchen darin ihren eigenen Namen. Auf 97 % der Websites finden sie ihn nicht. Das ist keine Ablehnung und keine überlegte Erlaubnis: es ist eine Frage, die noch nicht gestellt wurde, in einer Datei, die zehn Jahre älter ist als sie.
Jeder Crawler hat seine eigene Gruppe in einer robots.txt, eine Website antwortet OpenAI, Google und Common Crawl also getrennt. Die Tabelle liest diese Antworten einzeln.
| Crawler | Betrieben von | Was er mit der Seite tut | Websites, die ihn abweisen |
|---|---|---|---|
| CCBot | Common Crawl | Trainiert ein Modell | 2,0 % |
| GPTBot | OpenAI | Trainiert ein Modell | 2,0 % |
| Bytespider | ByteDance | Trainiert ein Modell | 1,8 % |
| ClaudeBot | Anthropic | Trainiert ein Modell | 1,8 % |
| Google-Extended | Trainiert ein Modell | 1,8 % | |
| Meta-ExternalAgent | Meta | Trainiert ein Modell | 1,7 % |
| Applebot-Extended | Apple | Trainiert ein Modell | 1,6 % |
| ChatGPT-User | OpenAI | Holt die Seite, wenn jemand eine Frage stellt | 0,3 % |
| PerplexityBot | Perplexity | Speist eine Antwortmaschine | 0,1 % |
| OAI-SearchBot | OpenAI | Speist eine Antwortmaschine | 0,1 % |
Der Abstand ist deutlich und trägt sich selbst: Crawler, die Modelle trainieren, werden von rund 2 % abgewiesen, jene, die eine Seite holen, um eine Frage zu beantworten, zwanzigmal seltener. Der französische Bestand nimmt an, zitiert zu werden, und lehnt ab, gelernt zu werden.
Das Training abzulehnen schützt Inhalte, für deren Erstellung ein Unternehmen bezahlt hat. Das ist eine vertretbare Entscheidung, und 2,2 % der Websites haben sie ausdrücklich getroffen.
Die Tür vor Antwortmaschinen zu schließen bringt eine andere hervor: Ihre Website hört genau in dem Moment auf, eine zitierbare Quelle zu sein, in dem Ihre Kundschaft ihre Fragen einer KI statt einer Suchmaschine stellt. 3,1 % der erhobenen Websites sind in dieser Lage, ohne es gewollt zu haben, durch eine Regel, die für alle Crawler geschrieben wurde, lange bevor es diese gab.
Beide Entscheidungen werden in derselben Datei getroffen, in drei Zeilen. Man muss sie nur schreiben können.
Eine robots.txt wird von der Maschine ausgeliefert, die die Website ausliefert. Lebt diese Website auf einer geschlossenen Plattform, schreibt die Plattform die Datei, wendet sie auf alle ihre Kunden zugleich an und aktualisiert sie, wann sie es entscheidet.
Wir haben 2 500 der Dateien aus der Erhebung erneut gelesen, um zu sehen, welche die Signatur einer Plattformvorlage tragen. Die Tabelle unten zeigt, was jede von ihnen für ihre Kunden antwortet.
| Plattform | Websites der Ziehung | Regelgruppen |
|---|---|---|
| Shopify | 57 | 2 |
| WordPress.com | 13 | 1 |
| Squarespace | 11 | 30 |
| Wix | 3 | 0 |
| Webflow | 1 | 0 |
| Datei ohne Plattformsignatur | 2.410 | 1 |
Squarespace liefert seinen Kunden eine Datei, die rund dreißig Crawler nennt, darunter alle aus der Tabelle oben, und keinen einzigen abweist. Shopify liefert eine, die keinen nennt. In beiden Fällen ist die Antwort für Tausende Websites dieselbe, und die Inhaberin einer dieser Websites hat diese Antwort weder geschrieben noch die Mittel, sie zu ändern.
Das unterscheidet eine Website, die man besitzt, von einer, die man bewohnt. Die Frage der KI-Crawler kam in zwei Jahren; die nächste kommt genauso schnell, und sie wird an derselben Stelle geregelt, in einer Datei, die jemand für Sie schreiben können muss.
Serenity ist eine Website, erstellt, gehostet, abgesichert und aktuell gehalten von Simafri, das seit 2002 Unternehmenswebsites erstellt, hostet und pflegt. Der Domainname wird auf den Namen der Kundin eingetragen, und ein Simafri-Suite-Konto ist enthalten.
Ziehungsrahmen: die 4 590 553 aktiven .fr-Domains aus der offenen Datendatei von Afnic Afnic, fichier des domaines .fr actifs. Daraus wird ein Panel von 15 000 Domains gezogen, geordnet nach dem sha256-Fingerabdruck jedes Namens, sodass jede und jeder aus dem veröffentlichten Startwert dasselbe Panel neu aufbauen kann. Das Panel bleibt von einer Erhebung zur nächsten dasselbe.
Lesekette: am 3. September 2026 lieferten 10 301 dieser Domains eine Seite aus. Für jede wurde die Datei robots.txt in derselben Verbindung angefragt. 98 % gaben eine geklärte Haltung zurück, also eine lesbare Datei oder eine Antwort, die besagt, dass es keine gibt, was alles erlaubt. Die Zahlen beziehen sich auf diese.
Was als Ablehnung zählt: ein Crawler ist abgewiesen, wenn seine eigene Regelgruppe ihm die Wurzel der Website verbietet. Eine Gruppe, die alle Crawler zugleich anspricht, wird gesondert erfasst, weil sie das Crawlen im Allgemeinen betrifft und nichts über KI sagt. Eine Website, deren Plattform Crawler in dieser allgemeinen Gruppe nennt, gilt daher nicht als eine, die entschieden hat.
Was nicht gelesen wurde: nichts, was Zugang zur Website, zu ihrer Verwaltung oder zu ihrem Hosting verlangt. Eine Anfrage für die Seite, eine für die Datei.
Reichweite: das Panel zieht aus allen aktiven .fr-Domains, Unternehmen, Vereine und Privatpersonen zusammen, ohne Qualifizierung über die Unternehmensnummer, anders als bei unseren beiden anderen Erhebungen. Die Zahlen beschreiben also den französischen Bestand als Ganzes. Die Plattformlesung umfasst 2 500 Websites, gezogen unter jenen, die eine Datei ausliefern.
Die Zahlen zum Bestand stammen aus einem öffentlichen Index, der seine Methode, sein datiertes Panel und seine wöchentliche Reihe veröffentlicht, gelesen am 3. September 2026. Die Reihe wird als JSON ausgeliefert, Crawler für Crawler, und lässt sich nachspielen.
Index und Methode ansehen (Stileex)
Das Panel wird jede Woche erhoben, was zeigen wird, ob sich der Bestand in dieser Frage bewegt und in welche Richtung.
Simafri ist seit 2002 der technische Verbündete Ihres Unternehmens: wir erstellen Ihre Website, hosten sie, pflegen sie und halten sie aktuell, mit Ihrem Domainnamen auf Ihren Namen eingetragen. Sie entscheiden, wer aus Ihren Seiten lernen und wer sie zitieren darf, wir machen den Handgriff. Schreiben Sie uns, wir sehen uns Ihren Fall gemeinsam an.
Simafri
Sprechen wir über Ihr Vorhaben
Sagen Sie uns in wenigen Worten, was Sie brauchen: Wir melden uns schnell bei Ihnen.
Sie schreiben lieber eine E-Mail? Schreiben Sie uns an support@simafri.com.
Das Formular wird nicht angezeigt? Schreiben Sie uns direkt:
support@simafri.com