O llms.txt é um convite feito aos assistentes de IA: um arquivo curto, na raiz do site, que diz quem você é e onde procurar. Este levantamento conta os sites que já o publicaram, e lê o que eles dizem a esses mesmos robôs no arquivo ao lado.
Um llms.txt é um arquivo Markdown colocado em /llms.txt. Ele apresenta o site em poucas linhas e aponta para as páginas que importam, para que um assistente de IA as leia diretamente em vez de reconstituir um site inteiro. O formato se resume a uma exigência: um título de nível 1 no topo, o resto é livre.
Ele responde a uma pergunta nova. Um mecanismo de busca percorre um site página por página e classifica o que encontra; um assistente, por sua vez, lê rápido, cita pouco e precisa que lhe digam onde está o essencial. 7,9 % dos sites .fr que respondem já tomaram posição sobre essa pergunta, dois anos depois de o formato ter sido proposto.
É a armadilha deste levantamento, e ela muda tudo: muitos sites devolvem sua página inicial para qualquer endereço desconhecido. Pedir /llms.txt a um site assim devolve um código 200 e uma página HTML, nunca um llms.txt. Uma contagem que para no código HTTP soma portanto as duas primeiras linhas da tabela e publica uma adoção cinco vezes alta demais.
| O que o site responde em /llms.txt | Parcela dos sites |
|---|---|
| Um arquivo que abre com um título Markdown | 7,9 % |
| Um código 200, mas outra coisa (quase sempre a página inicial) | 36,6 % |
| Uma resposta dizendo que o arquivo não existe | 55,5 % |
O levantamento lê o corpo da resposta e só conta como llms.txt o que abre com um título de nível 1, o único elemento que o formato exige.
Um site que publica um llms.txt convida os assistentes de IA a vir ler. O arquivo robots.txt, a três linhas dali, diz a esses mesmos robôs se eles têm o direito de entrar. Os dois são lidos na mesma manhã, no mesmo domínio.
Entre os sites que publicam um llms.txt, 2,8 % proíbem também sua raiz a pelo menos um robô de IA. No conjunto do parque .fr, essa parcela é de 2,2 %. Em outras palavras, publicar o convite não vem junto com abrir a porta: os sites que convidam recusam um pouco mais vezes do que os outros.
Nada disso é contraditório em si: recusar o treinamento de um modelo e querer ser bem lido por um assistente são duas decisões distintas, e elas podem perfeitamente conviver. O que o número mostra é que esses dois arquivos raramente são escritos juntos, embora respondam ao mesmo interlocutor.
O tamanho mediano é de 3 878 bytes, ou seja, cerca de quatro kilobytes: uma página de mapa, não uma cópia do site. Isso é coerente com o que o formato pede, e é também o que o torna sustentável ao longo do tempo.
Um llms.txt vale o que vale sua atualidade. Ele nomeia páginas, e uma página que muda de endereço deixa no arquivo uma linha que não leva mais a lugar nenhum. É um arquivo a retomar a cada reformulação, assim como um mapa do site.
O Serenity é um site criado, hospedado, protegido e mantido atualizado pela Simafri, que cria, hospeda e mantém sites de empresas desde 2012. O nome de domínio é registrado em nome do cliente, e uma conta Simafri Suite está incluída.
Quadro de sorteio: os 4 590 553 domínios .fr ativos do arquivo de dados abertos da Afnic Afnic, fichier des domaines .fr actifs. Dele é sorteada uma cesta de 15 000 domínios, ordenados pela impressão sha256 de cada nome, o que permite a qualquer pessoa reconstruir a mesma cesta a partir da semente publicada. A cesta continua a mesma de um levantamento para o outro, então um movimento da série é uma decisão do parque.
Cadeia de leitura: o /llms.txt é pedido uma vez por semana, na mesma passagem que já abre cada domínio da cesta. Os números se referem aos sites que respondem à pergunta, ou seja, 98 % dos que servem uma página: os que servem um arquivo, os que servem outra coisa e os que respondem que o arquivo não existe.
O que conta como llms.txt: um corpo que abre com um título Markdown de nível 1. O tamanho publicado é a mediana dos arquivos servidos, em bytes. O robots.txt é lido no mesmo domínio e na mesma manhã, e um robô de IA conta como recusado quando seu próprio grupo de instruções lhe proíbe a raiz.
O que não foi lido: nada que exija acesso ao site, a sua administração ou a sua hospedagem. Um pedido para a página, um para cada arquivo.
Alcance: a cesta sorteia no conjunto dos domínios .fr ativos, empresas, associações e pessoas físicas juntos, sem qualificação pelo número de empresa. Os números descrevem portanto o parque francês como um todo, e a parcela dos sites que recusam um robô de IA vem do mesmo levantamento semanal.
Os números vêm de um índice público que publica seu método, sua cesta datada e sua série semanal, levantamento de 4 de setembro de 2026. A série é servida em JSON e pode ser rejogada.
Ver o índice e seu método (Stileex)
A cesta é levantada toda semana, o que dirá em que ritmo o parque publica esse arquivo, e se quem o publica abre também sua porta.
A Simafri é a aliada técnica de sua empresa desde 2012: criamos seu site, hospedamos, mantemos e o deixamos atualizado, com seu nome de domínio registrado em seu nome. Seu llms.txt e seu robots.txt dizem o que você decidiu, e são retomados quando suas páginas mudam. Escreva para nós, olhamos seu caso juntos.
Simafri
Vamos falar de seu site
Conte para a gente sobre seu projeto em poucas palavras: responderemos rapidamente.
Obrigado! O seu pedido foi enviado. Responderemos em breve.
Prefere o e-mail? Escreva para a gente em support@simafri.com.