llms.txt e sites franceses: quem já colocou o ficheiro

O llms.txt é um convite feito aos assistentes de IA: um ficheiro curto, na raiz do site, que diz quem somos e onde procurar. Este levantamento conta os sites que o colocaram, e lê o que dizem a esses mesmos robôs no ficheiro ao lado.

Publicado a 5 de setembro de 2026 Cabaz de 15 000 domínios .fr, levantado a 4 de setembro de 2026

7,9 %dos sites .fr que respondem servem um verdadeiro llms.txt
3.878bytes, o tamanho mediano do ficheiro servido
2,8 %dos que o publicam recusam também um robô de IA

O que o ficheiro faz, e porque aparece agora

Um llms.txt é um ficheiro Markdown colocado em /llms.txt. Apresenta o site em poucas linhas e aponta para as páginas que contam, para que um assistente de IA as leia diretamente em vez de reconstituir um site inteiro. O formato resume-se a uma exigência: um título de nível 1 no início, o resto é livre.

Responde a uma pergunta nova. Um motor de busca percorre um site página a página e classifica o que encontra; um assistente, por seu lado, lê depressa, cita pouco e precisa que lhe digam onde está o essencial. 7,9 % dos sites .fr que respondem já tomaram posição sobre esta pergunta, dois anos depois de o formato ter sido proposto.

Responder 200 não quer dizer ter o ficheiro

É a armadilha deste levantamento, e muda tudo: muitos sites devolvem a sua página inicial para qualquer endereço desconhecido. Pedir /llms.txt a um site assim devolve um código 200 e uma página HTML, nunca um llms.txt. Uma contagem que para no código HTTP soma portanto as duas primeiras linhas da tabela e publica uma adoção cinco vezes alta demais.

O que o site responde em /llms.txt Parte dos sites
Um ficheiro que abre com um título Markdown 7,9 %
Um código 200, mas outra coisa (quase sempre a página inicial) 36,6 %
Uma resposta a dizer que o ficheiro não existe 55,5 %

O levantamento lê o corpo da resposta e só conta como llms.txt o que abre com um título de nível 1, o único elemento que o formato exige.

Dois ficheiros, duas mãos, duas respostas

Um site que coloca um llms.txt convida os assistentes de IA a vir ler. O ficheiro robots.txt, a três linhas dali, diz a esses mesmos robôs se têm o direito de entrar. Os dois leem-se na mesma manhã, no mesmo domínio.

Entre os sites que publicam um llms.txt, 2,8 % proíbem também a sua raiz a pelo menos um robô de IA. No conjunto do parque .fr, essa parte é de 2,2 %. Por outras palavras, colocar o convite não vem com abrir a porta: os sites que convidam recusam um pouco mais vezes do que os outros.

Nada disto é contraditório em si: recusar o treino de um modelo e querer ser bem lido por um assistente são duas decisões distintas, e podem perfeitamente coexistir. O que o número mostra é que estes dois ficheiros raramente são escritos em conjunto, embora respondam ao mesmo interlocutor.

Um ficheiro curto, que se mantém atualizado

O tamanho mediano é de 3 878 bytes, ou seja, cerca de quatro kilobytes: uma página de mapa, não uma cópia do site. É coerente com o que o formato pede, e é também o que o torna sustentável ao longo do tempo.

Um llms.txt vale o que vale a sua atualidade. Nomeia páginas, e uma página que muda de endereço deixa no ficheiro uma linha que já não leva a lado nenhum. É um ficheiro a retomar a cada remodelação, tal como um mapa do site.

Serenity, em claro

O Serenity é um site criado, alojado, protegido e mantido atualizado pela Simafri, que cria, aloja e mantém sites de empresas desde 2012. O nome de domínio é registado em nome do cliente, e uma conta Simafri Suite está incluída.

Ver a oferta e os preços

Método

Quadro de sorteio: os 4 590 553 domínios .fr ativos do ficheiro de dados abertos da Afnic Afnic, fichier des domaines .fr actifs. Dele é sorteado um cabaz de 15 000 domínios, ordenados pela impressão sha256 de cada nome, o que permite a qualquer pessoa reconstruir o mesmo cabaz a partir da semente publicada. O cabaz mantém-se o mesmo de um levantamento para o outro, pelo que um movimento da série é uma decisão do parque.

Cadeia de leitura: o /llms.txt é pedido uma vez por semana, na mesma passagem que já abre cada domínio do cabaz. Os números referem-se aos sites que respondem à pergunta, ou seja, 98 % dos que servem uma página: os que servem um ficheiro, os que servem outra coisa e os que respondem que o ficheiro não existe.

O que conta como llms.txt: um corpo que abre com um título Markdown de nível 1. O tamanho publicado é a mediana dos ficheiros servidos, em bytes. O robots.txt é lido no mesmo domínio e na mesma manhã, e um robô de IA conta como recusado quando o seu próprio grupo de instruções lhe proíbe a raiz.

O que não foi lido: nada que exija acesso ao site, à sua administração ou ao seu alojamento. Um pedido para a página, um para cada ficheiro.

Alcance: o cabaz sorteia no conjunto dos domínios .fr ativos, empresas, associações e particulares juntos, sem qualificação pelo número de empresa. Os números descrevem portanto o parque francês no seu conjunto, e a parte dos sites que recusam um robô de IA vem do mesmo levantamento semanal.

Fonte e reutilização

Os números vêm de um índice público que publica o seu método, o seu cabaz datado e a sua série semanal, levantamento de 4 de setembro de 2026. A série é servida em JSON e pode ser rejogada.

Ver o índice e o seu método (Stileex)

API JSON

O cabaz é levantado todas as semanas, o que dirá a que velocidade o parque coloca este ficheiro, e se os que o colocam abrem também a sua porta.

Colocar o seu llms.txt, e mantê-lo

A Simafri é a aliada técnica da sua empresa desde 2012: criamos o seu site, alojamo-lo, mantemo-lo e mantemo-lo atualizado, com o seu nome de domínio registado em seu nome. O seu llms.txt e o seu robots.txt dizem o que decidiu, e são retomados quando as suas páginas mudam. Escreva-nos, olhamos para o seu caso em conjunto.

Contacte-nos