llms.txt e sites franceses: quem já publicou o arquivo

O llms.txt é um convite feito aos assistentes de IA: um arquivo curto, na raiz do site, que diz quem você é e onde procurar. Este levantamento conta os sites que já o publicaram, e lê o que eles dizem a esses mesmos robôs no arquivo ao lado.

Publicado em 5 de setembro de 2026 Cesta de 15 000 domínios .fr, levantada em 4 de setembro de 2026

7,9 %dos sites .fr que respondem servem um llms.txt de verdade
3.878bytes, o tamanho mediano do arquivo servido
2,8 %dos que o publicam recusam também um robô de IA

O que o arquivo faz, e por que ele aparece agora

Um llms.txt é um arquivo Markdown colocado em /llms.txt. Ele apresenta o site em poucas linhas e aponta para as páginas que importam, para que um assistente de IA as leia diretamente em vez de reconstituir um site inteiro. O formato se resume a uma exigência: um título de nível 1 no topo, o resto é livre.

Ele responde a uma pergunta nova. Um mecanismo de busca percorre um site página por página e classifica o que encontra; um assistente, por sua vez, lê rápido, cita pouco e precisa que lhe digam onde está o essencial. 7,9 % dos sites .fr que respondem já tomaram posição sobre essa pergunta, dois anos depois de o formato ter sido proposto.

Responder 200 não quer dizer ter o arquivo

É a armadilha deste levantamento, e ela muda tudo: muitos sites devolvem sua página inicial para qualquer endereço desconhecido. Pedir /llms.txt a um site assim devolve um código 200 e uma página HTML, nunca um llms.txt. Uma contagem que para no código HTTP soma portanto as duas primeiras linhas da tabela e publica uma adoção cinco vezes alta demais.

O que o site responde em /llms.txt Parcela dos sites
Um arquivo que abre com um título Markdown 7,9 %
Um código 200, mas outra coisa (quase sempre a página inicial) 36,6 %
Uma resposta dizendo que o arquivo não existe 55,5 %

O levantamento lê o corpo da resposta e só conta como llms.txt o que abre com um título de nível 1, o único elemento que o formato exige.

Dois arquivos, duas mãos, duas respostas

Um site que publica um llms.txt convida os assistentes de IA a vir ler. O arquivo robots.txt, a três linhas dali, diz a esses mesmos robôs se eles têm o direito de entrar. Os dois são lidos na mesma manhã, no mesmo domínio.

Entre os sites que publicam um llms.txt, 2,8 % proíbem também sua raiz a pelo menos um robô de IA. No conjunto do parque .fr, essa parcela é de 2,2 %. Em outras palavras, publicar o convite não vem junto com abrir a porta: os sites que convidam recusam um pouco mais vezes do que os outros.

Nada disso é contraditório em si: recusar o treinamento de um modelo e querer ser bem lido por um assistente são duas decisões distintas, e elas podem perfeitamente conviver. O que o número mostra é que esses dois arquivos raramente são escritos juntos, embora respondam ao mesmo interlocutor.

Um arquivo curto, que se mantém atualizado

O tamanho mediano é de 3 878 bytes, ou seja, cerca de quatro kilobytes: uma página de mapa, não uma cópia do site. Isso é coerente com o que o formato pede, e é também o que o torna sustentável ao longo do tempo.

Um llms.txt vale o que vale sua atualidade. Ele nomeia páginas, e uma página que muda de endereço deixa no arquivo uma linha que não leva mais a lugar nenhum. É um arquivo a retomar a cada reformulação, assim como um mapa do site.

Serenity, em claro

O Serenity é um site criado, hospedado, protegido e mantido atualizado pela Simafri, que cria, hospeda e mantém sites de empresas desde 2012. O nome de domínio é registrado em nome do cliente, e uma conta Simafri Suite está incluída.

Ver a oferta e os preços

Método

Quadro de sorteio: os 4 590 553 domínios .fr ativos do arquivo de dados abertos da Afnic Afnic, fichier des domaines .fr actifs. Dele é sorteada uma cesta de 15 000 domínios, ordenados pela impressão sha256 de cada nome, o que permite a qualquer pessoa reconstruir a mesma cesta a partir da semente publicada. A cesta continua a mesma de um levantamento para o outro, então um movimento da série é uma decisão do parque.

Cadeia de leitura: o /llms.txt é pedido uma vez por semana, na mesma passagem que já abre cada domínio da cesta. Os números se referem aos sites que respondem à pergunta, ou seja, 98 % dos que servem uma página: os que servem um arquivo, os que servem outra coisa e os que respondem que o arquivo não existe.

O que conta como llms.txt: um corpo que abre com um título Markdown de nível 1. O tamanho publicado é a mediana dos arquivos servidos, em bytes. O robots.txt é lido no mesmo domínio e na mesma manhã, e um robô de IA conta como recusado quando seu próprio grupo de instruções lhe proíbe a raiz.

O que não foi lido: nada que exija acesso ao site, a sua administração ou a sua hospedagem. Um pedido para a página, um para cada arquivo.

Alcance: a cesta sorteia no conjunto dos domínios .fr ativos, empresas, associações e pessoas físicas juntos, sem qualificação pelo número de empresa. Os números descrevem portanto o parque francês como um todo, e a parcela dos sites que recusam um robô de IA vem do mesmo levantamento semanal.

Fonte e reutilização

Os números vêm de um índice público que publica seu método, sua cesta datada e sua série semanal, levantamento de 4 de setembro de 2026. A série é servida em JSON e pode ser rejogada.

Ver o índice e seu método (Stileex)

API JSON

A cesta é levantada toda semana, o que dirá em que ritmo o parque publica esse arquivo, e se quem o publica abre também sua porta.

Publicar seu llms.txt, e mantê-lo em dia

A Simafri é a aliada técnica de sua empresa desde 2012: criamos seu site, hospedamos, mantemos e o deixamos atualizado, com seu nome de domínio registrado em seu nome. Seu llms.txt e seu robots.txt dizem o que você decidiu, e são retomados quando suas páginas mudam. Escreva para nós, olhamos seu caso juntos.

Entre em contato