O llms.txt é um convite feito aos assistentes de IA: um ficheiro curto, na raiz do site, que diz quem somos e onde procurar. Este levantamento conta os sites que o colocaram, e lê o que dizem a esses mesmos robôs no ficheiro ao lado.
Um llms.txt é um ficheiro Markdown colocado em /llms.txt. Apresenta o site em poucas linhas e aponta para as páginas que contam, para que um assistente de IA as leia diretamente em vez de reconstituir um site inteiro. O formato resume-se a uma exigência: um título de nível 1 no início, o resto é livre.
Responde a uma pergunta nova. Um motor de busca percorre um site página a página e classifica o que encontra; um assistente, por seu lado, lê depressa, cita pouco e precisa que lhe digam onde está o essencial. 7,9 % dos sites .fr que respondem já tomaram posição sobre esta pergunta, dois anos depois de o formato ter sido proposto.
É a armadilha deste levantamento, e muda tudo: muitos sites devolvem a sua página inicial para qualquer endereço desconhecido. Pedir /llms.txt a um site assim devolve um código 200 e uma página HTML, nunca um llms.txt. Uma contagem que para no código HTTP soma portanto as duas primeiras linhas da tabela e publica uma adoção cinco vezes alta demais.
| O que o site responde em /llms.txt | Parte dos sites |
|---|---|
| Um ficheiro que abre com um título Markdown | 7,9 % |
| Um código 200, mas outra coisa (quase sempre a página inicial) | 36,6 % |
| Uma resposta a dizer que o ficheiro não existe | 55,5 % |
O levantamento lê o corpo da resposta e só conta como llms.txt o que abre com um título de nível 1, o único elemento que o formato exige.
Um site que coloca um llms.txt convida os assistentes de IA a vir ler. O ficheiro robots.txt, a três linhas dali, diz a esses mesmos robôs se têm o direito de entrar. Os dois leem-se na mesma manhã, no mesmo domínio.
Entre os sites que publicam um llms.txt, 2,8 % proíbem também a sua raiz a pelo menos um robô de IA. No conjunto do parque .fr, essa parte é de 2,2 %. Por outras palavras, colocar o convite não vem com abrir a porta: os sites que convidam recusam um pouco mais vezes do que os outros.
Nada disto é contraditório em si: recusar o treino de um modelo e querer ser bem lido por um assistente são duas decisões distintas, e podem perfeitamente coexistir. O que o número mostra é que estes dois ficheiros raramente são escritos em conjunto, embora respondam ao mesmo interlocutor.
O tamanho mediano é de 3 878 bytes, ou seja, cerca de quatro kilobytes: uma página de mapa, não uma cópia do site. É coerente com o que o formato pede, e é também o que o torna sustentável ao longo do tempo.
Um llms.txt vale o que vale a sua atualidade. Nomeia páginas, e uma página que muda de endereço deixa no ficheiro uma linha que já não leva a lado nenhum. É um ficheiro a retomar a cada remodelação, tal como um mapa do site.
O Serenity é um site criado, alojado, protegido e mantido atualizado pela Simafri, que cria, aloja e mantém sites de empresas desde 2012. O nome de domínio é registado em nome do cliente, e uma conta Simafri Suite está incluída.
Quadro de sorteio: os 4 590 553 domínios .fr ativos do ficheiro de dados abertos da Afnic Afnic, fichier des domaines .fr actifs. Dele é sorteado um cabaz de 15 000 domínios, ordenados pela impressão sha256 de cada nome, o que permite a qualquer pessoa reconstruir o mesmo cabaz a partir da semente publicada. O cabaz mantém-se o mesmo de um levantamento para o outro, pelo que um movimento da série é uma decisão do parque.
Cadeia de leitura: o /llms.txt é pedido uma vez por semana, na mesma passagem que já abre cada domínio do cabaz. Os números referem-se aos sites que respondem à pergunta, ou seja, 98 % dos que servem uma página: os que servem um ficheiro, os que servem outra coisa e os que respondem que o ficheiro não existe.
O que conta como llms.txt: um corpo que abre com um título Markdown de nível 1. O tamanho publicado é a mediana dos ficheiros servidos, em bytes. O robots.txt é lido no mesmo domínio e na mesma manhã, e um robô de IA conta como recusado quando o seu próprio grupo de instruções lhe proíbe a raiz.
O que não foi lido: nada que exija acesso ao site, à sua administração ou ao seu alojamento. Um pedido para a página, um para cada ficheiro.
Alcance: o cabaz sorteia no conjunto dos domínios .fr ativos, empresas, associações e particulares juntos, sem qualificação pelo número de empresa. Os números descrevem portanto o parque francês no seu conjunto, e a parte dos sites que recusam um robô de IA vem do mesmo levantamento semanal.
Os números vêm de um índice público que publica o seu método, o seu cabaz datado e a sua série semanal, levantamento de 4 de setembro de 2026. A série é servida em JSON e pode ser rejogada.
Ver o índice e o seu método (Stileex)
O cabaz é levantado todas as semanas, o que dirá a que velocidade o parque coloca este ficheiro, e se os que o colocam abrem também a sua porta.
A Simafri é a aliada técnica da sua empresa desde 2012: criamos o seu site, alojamo-lo, mantemo-lo e mantemo-lo atualizado, com o seu nome de domínio registado em seu nome. O seu llms.txt e o seu robots.txt dizem o que decidiu, e são retomados quando as suas páginas mudam. Escreva-nos, olhamos para o seu caso em conjunto.
Simafri
Vamos falar do seu projeto
Diga-nos em poucas palavras o que precisa: respondemos-lhe rapidamente.
Obrigado! O seu pedido foi enviado. Responderemos em breve.
Prefere o email? Escreva-nos para support@simafri.com.