Zanim robot AI przeczyta stronę, czyta plik, który mówi, co wolno mu z nią zrobić. Ten plik istnieje na większości stron. Ten pomiar patrzy, co odpowiada, a przede wszystkim kto go napisał.
85,3 % zmierzonych stron publikuje plik robots.txt. Ten plik ma swoją historię: napisano go dla wyszukiwarek, w czasach gdy pytanie brzmiało, które strony zostaną zaindeksowane. Połowa tych plików mieści się w jednej grupie reguł, a ta grupa zwraca się do wszystkich naraz.
Roboty AI czytają ten sam plik i szukają w nim własnej nazwy. Nie znajdują jej na 97 % stron. To nie jest odmowa ani przemyślana zgoda: to pytanie, którego jeszcze nie zadano, w pliku o dziesięć lat od niego starszym.
Każdy robot ma własną grupę w pliku robots.txt, więc strona odpowiada osobno OpenAI, Google i Common Crawl. Tabela czyta te odpowiedzi jedna po drugiej.
| Robot | Prowadzony przez | Co robi ze stroną | Strony, które mu odmawiają |
|---|---|---|---|
| CCBot | Common Crawl | Trenuje model | 2,0 % |
| GPTBot | OpenAI | Trenuje model | 2,0 % |
| Bytespider | ByteDance | Trenuje model | 1,8 % |
| ClaudeBot | Anthropic | Trenuje model | 1,8 % |
| Google-Extended | Trenuje model | 1,8 % | |
| Meta-ExternalAgent | Meta | Trenuje model | 1,7 % |
| Applebot-Extended | Apple | Trenuje model | 1,6 % |
| ChatGPT-User | OpenAI | Pobiera stronę, gdy ktoś zadaje pytanie | 0,3 % |
| PerplexityBot | Perplexity | Zasila wyszukiwarkę odpowiedzi | 0,1 % |
| OAI-SearchBot | OpenAI | Zasila wyszukiwarkę odpowiedzi | 0,1 % |
Różnica jest wyraźna i broni się sama: roboty trenujące modele są odrzucane przez około 2 %, te, które pobierają stronę, by odpowiedzieć na pytanie, dwadzieścia razy rzadziej. Francuski zbiór godzi się być cytowany i odmawia bycia wyuczonym.
Odmowa trenowania chroni treść, za której wytworzenie firma zapłaciła. To decyzja, której można bronić, i 2,2 % stron podjęło ją wprost.
Zamknięcie drzwi wyszukiwarkom odpowiedzi rodzi inną: Państwa strona przestaje być źródłem, które można zacytować, dokładnie w chwili gdy Państwa klienci zadają pytania sztucznej inteligencji zamiast wyszukiwarce. 3,1 % zmierzonych stron znalazło się w tej sytuacji, nie chcąc tego, przez regułę napisaną dla wszystkich robotów na długo przed ich powstaniem.
Obie decyzje zapadają w tym samym pliku, w trzech wierszach. Trzeba tylko móc go napisać.
Plik robots.txt serwuje ta sama maszyna, która serwuje stronę. Gdy strona żyje na zamkniętej platformie, to platforma go redaguje, stosuje wobec wszystkich swoich klientów naraz i aktualizuje wtedy, gdy sama zdecyduje.
Przeczytaliśmy ponownie 2 500 plików z pomiaru, aby zobaczyć, które noszą podpis szablonu platformy. Poniższa tabela pokazuje, co każda z nich odpowiada za swoich klientów.
| Platforma | Strony w losowaniu | Grupy reguł |
|---|---|---|
| Shopify | 57 | 2 |
| WordPress.com | 13 | 1 |
| Squarespace | 11 | 30 |
| Wix | 3 | 0 |
| Webflow | 1 | 0 |
| Plik bez podpisu platformy | 2410 | 1 |
Squarespace serwuje swoim klientom plik, który wymienia około trzydziestu robotów, w tym wszystkie z powyższej tabeli, i żadnemu nie odmawia. Shopify serwuje plik, który nie wymienia żadnego. W obu przypadkach odpowiedź jest ta sama dla tysięcy stron, a właściciel jednej z nich ani jej nie napisał, ani nie ma jak jej zmienić.
To właśnie odróżnia stronę, którą się posiada, od strony, którą się zajmuje. Pytanie o roboty AI przyszło w dwa lata; następne przyjdzie równie szybko i rozstrzygnie się w tym samym miejscu, w pliku, który ktoś musi móc napisać dla Państwa.
Serenity to strona internetowa tworzona, hostowana, zabezpieczana i utrzymywana w aktualności przez Simafri, które tworzy, hostuje i utrzymuje strony firm od 2002 roku. Nazwa domeny jest zarejestrowana na klienta, a konto Simafri Suite jest w cenie.
Operat losowania: 4 590 553 aktywne domeny .fr z otwartego pliku danych Afnic Afnic, fichier des domaines .fr actifs. Losuje się z niego panel 15 000 domen, uporządkowanych według odcisku sha256 każdej nazwy, co pozwala każdemu odtworzyć ten sam panel na podstawie opublikowanego ziarna. Panel pozostaje ten sam z pomiaru na pomiar.
Łańcuch odczytu: 3 września 2026 roku 10 301 z tych domen zwróciło stronę. Dla każdej z nich plik robots.txt został pobrany w tej samej rozmowie. 98 % zwróciło ustaloną politykę, to jest czytelny plik albo odpowiedź mówiącą, że go nie ma, co zezwala na wszystko. Liczby dotyczą tych właśnie.
Co liczy się jako odmowa: robot jest odrzucony, gdy jego własna grupa reguł zabrania mu katalogu głównego strony. Grupa zwracająca się do wszystkich robotów naraz jest zapisywana osobno, bo dotyczy indeksowania w ogóle i nic nie mówi o AI. Strona, której platforma wymienia roboty wewnątrz tej ogólnej grupy, nie liczy się więc jako ta, która podjęła decyzję.
Czego nie czytano: niczego, co wymaga dostępu do strony, jej administracji czy hostingu. Jedno zapytanie o stronę, jedno o plik.
Zasięg: panel losuje spośród wszystkich aktywnych domen .fr, firm, stowarzyszeń i osób prywatnych razem, bez kwalifikacji przez numer firmy, inaczej niż w naszych dwóch pozostałych pomiarach. Liczby opisują zatem francuski zbiór jako całość. Odczyt platform obejmuje 2 500 stron wylosowanych spośród tych, które serwują plik.
Liczby o zbiorze pochodzą z publicznego indeksu, który publikuje swoją metodę, datowany panel i cotygodniową serię, odczytanego 3 września 2026. Seria jest serwowana w JSON, robot po robocie, i daje się odtworzyć.
Zobacz indeks i jego metodę (Stileex)
Panel jest mierzony co tydzień, co pokaże, czy zbiór porusza się w tej sprawie i w którą stronę.
Simafri jest technicznym sojusznikiem Państwa firmy od 2002 roku: tworzymy Państwa stronę, hostujemy ją, utrzymujemy i aktualizujemy, z nazwą domeny zarejestrowaną na Państwa. Państwo decydują, kto może uczyć się z Państwa stron, a kto może je cytować, my wykonujemy gest. Proszę do nas napisać, przyjrzymy się sprawie razem.
Simafri
Porozmawiajmy o Państwa projekcie
Proszę powiedzieć nam w kilku słowach, czego Państwo potrzebują: odpowiemy szybko.
Wolą Państwo e-mail? Proszę napisać do nas na support@simafri.com.
Formularz się nie wyświetla? Proszę napisać do nas bezpośrednio:
support@simafri.com