Roboty AI i francuskie strony: kto decyduje o odpowiedzi

Zanim robot AI przeczyta stronę, czyta plik, który mówi, co wolno mu z nią zrobić. Ten plik istnieje na większości stron. Ten pomiar patrzy, co odpowiada, a przede wszystkim kto go napisał.

Opublikowano 3 września 2026 10 301 stron .fr, zmierzonych 3 września 2026

97 %stron nie wymienia żadnego robota AI w swoim pliku robots.txt
2,2 %odmawia co najmniej jednemu, wymieniając go z nazwy
3,1 %zamyka swój katalog główny wszystkim robotom, wyszukiwarkom włącznie

Plik już tam jest, tyle że rozmawia z kimś innym

85,3 % zmierzonych stron publikuje plik robots.txt. Ten plik ma swoją historię: napisano go dla wyszukiwarek, w czasach gdy pytanie brzmiało, które strony zostaną zaindeksowane. Połowa tych plików mieści się w jednej grupie reguł, a ta grupa zwraca się do wszystkich naraz.

Roboty AI czytają ten sam plik i szukają w nim własnej nazwy. Nie znajdują jej na 97 % stron. To nie jest odmowa ani przemyślana zgoda: to pytanie, którego jeszcze nie zadano, w pliku o dziesięć lat od niego starszym.

Czego odmawia ten zbiór, robot po robocie

Każdy robot ma własną grupę w pliku robots.txt, więc strona odpowiada osobno OpenAI, Google i Common Crawl. Tabela czyta te odpowiedzi jedna po drugiej.

Robot Prowadzony przez Co robi ze stroną Strony, które mu odmawiają
CCBot Common Crawl Trenuje model 2,0 %
GPTBot OpenAI Trenuje model 2,0 %
Bytespider ByteDance Trenuje model 1,8 %
ClaudeBot Anthropic Trenuje model 1,8 %
Google-Extended Google Trenuje model 1,8 %
Meta-ExternalAgent Meta Trenuje model 1,7 %
Applebot-Extended Apple Trenuje model 1,6 %
ChatGPT-User OpenAI Pobiera stronę, gdy ktoś zadaje pytanie 0,3 %
PerplexityBot Perplexity Zasila wyszukiwarkę odpowiedzi 0,1 %
OAI-SearchBot OpenAI Zasila wyszukiwarkę odpowiedzi 0,1 %

Różnica jest wyraźna i broni się sama: roboty trenujące modele są odrzucane przez około 2 %, te, które pobierają stronę, by odpowiedzieć na pytanie, dwadzieścia razy rzadziej. Francuski zbiór godzi się być cytowany i odmawia bycia wyuczonym.

Te dwie decyzje to nie to samo

Odmowa trenowania chroni treść, za której wytworzenie firma zapłaciła. To decyzja, której można bronić, i 2,2 % stron podjęło ją wprost.

Zamknięcie drzwi wyszukiwarkom odpowiedzi rodzi inną: Państwa strona przestaje być źródłem, które można zacytować, dokładnie w chwili gdy Państwa klienci zadają pytania sztucznej inteligencji zamiast wyszukiwarce. 3,1 % zmierzonych stron znalazło się w tej sytuacji, nie chcąc tego, przez regułę napisaną dla wszystkich robotów na długo przed ich powstaniem.

Obie decyzje zapadają w tym samym pliku, w trzech wierszach. Trzeba tylko móc go napisać.

Na zamkniętej platformie ten plik nie należy do Państwa

Plik robots.txt serwuje ta sama maszyna, która serwuje stronę. Gdy strona żyje na zamkniętej platformie, to platforma go redaguje, stosuje wobec wszystkich swoich klientów naraz i aktualizuje wtedy, gdy sama zdecyduje.

Przeczytaliśmy ponownie 2 500 plików z pomiaru, aby zobaczyć, które noszą podpis szablonu platformy. Poniższa tabela pokazuje, co każda z nich odpowiada za swoich klientów.

Platforma Strony w losowaniu Grupy reguł
Shopify 57 2
WordPress.com 13 1
Squarespace 11 30
Wix 3 0
Webflow 1 0
Plik bez podpisu platformy 2410 1

Squarespace serwuje swoim klientom plik, który wymienia około trzydziestu robotów, w tym wszystkie z powyższej tabeli, i żadnemu nie odmawia. Shopify serwuje plik, który nie wymienia żadnego. W obu przypadkach odpowiedź jest ta sama dla tysięcy stron, a właściciel jednej z nich ani jej nie napisał, ani nie ma jak jej zmienić.

To właśnie odróżnia stronę, którą się posiada, od strony, którą się zajmuje. Pytanie o roboty AI przyszło w dwa lata; następne przyjdzie równie szybko i rozstrzygnie się w tym samym miejscu, w pliku, który ktoś musi móc napisać dla Państwa.

Serenity, bez owijania

Serenity to strona internetowa tworzona, hostowana, zabezpieczana i utrzymywana w aktualności przez Simafri, które tworzy, hostuje i utrzymuje strony firm od 2002 roku. Nazwa domeny jest zarejestrowana na klienta, a konto Simafri Suite jest w cenie.

Zobacz ofertę i cennik

Metoda

Operat losowania: 4 590 553 aktywne domeny .fr z otwartego pliku danych Afnic Afnic, fichier des domaines .fr actifs. Losuje się z niego panel 15 000 domen, uporządkowanych według odcisku sha256 każdej nazwy, co pozwala każdemu odtworzyć ten sam panel na podstawie opublikowanego ziarna. Panel pozostaje ten sam z pomiaru na pomiar.

Łańcuch odczytu: 3 września 2026 roku 10 301 z tych domen zwróciło stronę. Dla każdej z nich plik robots.txt został pobrany w tej samej rozmowie. 98 % zwróciło ustaloną politykę, to jest czytelny plik albo odpowiedź mówiącą, że go nie ma, co zezwala na wszystko. Liczby dotyczą tych właśnie.

Co liczy się jako odmowa: robot jest odrzucony, gdy jego własna grupa reguł zabrania mu katalogu głównego strony. Grupa zwracająca się do wszystkich robotów naraz jest zapisywana osobno, bo dotyczy indeksowania w ogóle i nic nie mówi o AI. Strona, której platforma wymienia roboty wewnątrz tej ogólnej grupy, nie liczy się więc jako ta, która podjęła decyzję.

Czego nie czytano: niczego, co wymaga dostępu do strony, jej administracji czy hostingu. Jedno zapytanie o stronę, jedno o plik.

Zasięg: panel losuje spośród wszystkich aktywnych domen .fr, firm, stowarzyszeń i osób prywatnych razem, bez kwalifikacji przez numer firmy, inaczej niż w naszych dwóch pozostałych pomiarach. Liczby opisują zatem francuski zbiór jako całość. Odczyt platform obejmuje 2 500 stron wylosowanych spośród tych, które serwują plik.

Źródło i ponowne wykorzystanie

Liczby o zbiorze pochodzą z publicznego indeksu, który publikuje swoją metodę, datowany panel i cotygodniową serię, odczytanego 3 września 2026. Seria jest serwowana w JSON, robot po robocie, i daje się odtworzyć.

Zobacz indeks i jego metodę (Stileex)

API JSON

Panel jest mierzony co tydzień, co pokaże, czy zbiór porusza się w tej sprawie i w którą stronę.

Odzyskać decyzję o tym, co odpowiada Państwa strona

Simafri jest technicznym sojusznikiem Państwa firmy od 2002 roku: tworzymy Państwa stronę, hostujemy ją, utrzymujemy i aktualizujemy, z nazwą domeny zarejestrowaną na Państwa. Państwo decydują, kto może uczyć się z Państwa stron, a kto może je cytować, my wykonujemy gest. Proszę do nas napisać, przyjrzymy się sprawie razem.