Tous les quelques mois, un nouveau fichier promet de faire entrer votre site dans les réponses de ChatGPT. En ce moment, ce fichier s'appelle llms.txt. L'argument est simple : déposez un fichier markdown à la racine de votre site et les moteurs IA vous comprendront mieux et vous citeront davantage. Ça semble plausible, l'adoption grimpe, et de nombreux plugins et agences le vendent désormais comme un incontournable du référencement pour l'IA.
Alors, est-ce que ça fonctionne vraiment ? La réponse honnête, appuyée par les données actuelles : llms.txt est bien réel, peu coûteux à ajouter, et réellement utile pour un public précis, mais il ne fait quasiment rien pour ce que la plupart des gens l'ajoutent, à savoir se faire citer par ChatGPT ou par les AI Overviews de Google. Ce guide explique ce que c'est, comment en créer un, et quand il vaut réellement votre temps.
Ce qu'est vraiment llms.txt
llms.txt est une convention proposée : un unique fichier markdown à la racine de votre site (/llms.txt) qui remet aux grands modèles de langage une version propre et sélectionnée de votre contenu le plus important. Elle a été proposée par Jeremy Howard (d'Answer.AI et fast.ai) en septembre 2024.
Le problème qu'il tente de résoudre est réel. Un LLM dispose d'une fenêtre de contexte limitée et ne peut pas lire tout votre site. Votre HTML est aussi rempli de navigation, de scripts et de balisage qui gaspillent des tokens et enterrent le contenu réel. llms.txt est censé donner au modèle une carte markdown concise de ce qui compte, pour qu'il puisse utiliser votre contenu au moment de l'inférence sans tout crawler et parser.
Une chose qu'il n'est pas : robots.txt. Ces deux fichiers sont des opposés. robots.txt contrôle si les bots peuvent accéder à vos pages. llms.txt fait l'inverse, en invitant les modèles à entrer et en leur remettant un résumé sélectionné. L'un est une barrière, l'autre est un guide.
llms.txt vs llms-full.txt vs robots.txt
Trois fichiers sont sans cesse confondus. Voici la différence :
| Fichier | Ce qu'il fait | Qui le lit |
|---|---|---|
| robots.txt | Contrôle d'accès : autoriser ou bloquer les crawlers sur des chemins précis | Moteurs de recherche et crawlers IA (standard établi) |
| llms.txt | Un index markdown sélectionné de vos pages clés, avec de courtes descriptions | LLMs et agents IA (convention proposée) |
| llms-full.txt | Le contenu complet de ces pages, concaténé dans un seul fichier propre | LLMs et agents IA (convention proposée) |
Voyez ça ainsi : llms.txt est la table des matières, llms-full.txt est le livre entier dans un seul fichier propre. À noter : seul llms.txt est défini par la spécification centrale ; llms-full.txt est une convention compagnon qui s'est développée autour.
À quoi ressemble un fichier llms.txt
Le format est un markdown volontairement simple, dans cet ordre : un H1 avec votre nom (la seule partie obligatoire), un résumé en bloc de citation, un contexte optionnel, puis des sections H2 listant des liens sous la forme [Titre](URL): description. Un court exemple :
# Sublim Analytics
> Privacy-first, cookieless web analytics for teams that want complete data without a consent banner.
Sublim measures 100% of your traffic, includes behavioral analytics, and is hosted in the EU.
## Docs
- [Getting started](https://sublimanalytics.com/docs/start): install the script in one line
- [Tracking events](https://sublimanalytics.com/docs/events): measure goals and conversions
## Guides
- [Web analytics for marketers](https://sublimanalytics.com/blog/guides/web-analytics-for-marketers): what to measure and why
Vous pouvez l'écrire à la main, le générer depuis votre CMS (des plugins SEO comme Yoast peuvent en produire un), ou passer votre site dans un générateur ou un outil de crawl. C'est un fichier statique, donc il n'y a pas d'entretien continu au-delà de garder les liens à jour.
Est-ce que ça fonctionne vraiment ?
Voici la partie que la plupart des guides sautent, car elle sape l'argument. Si votre objectif est d'être cité plus souvent par ChatGPT, Perplexity ou les AI Overviews de Google, les données actuelles indiquent que llms.txt ne change rien.
- L'adoption est faible. Une étude de SE Ranking sur 300 000 domaines a trouvé qu'environ 10 % seulement avaient un fichier llms.txt, plus d'un an après le lancement de l'idée. La même analyse n'a trouvé aucune corrélation entre le fait d'avoir le fichier et le fait d'être cité par l'IA. Le retirer de leur modèle a même amélioré les prédictions, ce qui veut dire que le fichier ajoutait du bruit, pas du signal.
- Les grands moteurs IA ne l'utilisent pas. Gary Illyes, de Google, a confirmé que Google Search ne prend pas en charge llms.txt et ne compte pas le faire. John Mueller l'a comparé à l'ancienne balise meta keywords : aucun service IA n'a dit qu'il utilisait llms.txt, et les logs serveur montrent que les bots ne demandent même pas le fichier.
- La raison est structurelle. llms.txt est un signal que vous écrivez sur vous-même et que vous contrôlez entièrement. Les moteurs de recherche ont appris il y a longtemps que les signaux auto-déclarés sont triviaux à manipuler et donc sans valeur pour le classement. C'est exactement pour ça que la balise meta keywords est morte. Comme l'a formulé Mueller : pourquoi un modèle ferait-il confiance à ce qu'un site affirme sur lui-même, alors qu'il peut simplement lire le site directement ?
Donc quand un plugin ou une agence vous dit qu'ajouter llms.txt vous fera entrer dans les réponses IA, traitez ça comme une affirmation, pas comme un fait.
Là où llms.txt aide réellement : le web agentique
Il existe un vrai cas d'usage, mais pas celui qu'on survend. Les outils qui lisent réellement /llms.txt et /llms-full.txt aujourd'hui sont les agents de code IA et les outils pour développeurs : Cursor, Claude Code, GitHub Copilot, Windsurf, Cline, et les intégrations basées sur MCP. Pointez l'un d'eux vers un site de documentation et il cherchera llms.txt pour charger un contexte propre rapidement, au lieu de scraper du HTML rendu.
Cela rend llms.txt réellement intéressant si vous publiez :
- De la documentation développeur ou une référence d'API.
- Un produit technique que les gens utilisent depuis l'intérieur d'assistants de code.
- Tout ce qui est destiné à être consommé par des agents IA, pas seulement par des lecteurs humains.
Pour un site de documentation, llms.txt est un ajout petit mais à fort effet de levier. Pour un blog marketing qui espère se classer dans ChatGPT, c'est quasiment sans effet. (À noter : le Lighthouse de Chrome a récemment ajouté un audit « agentique » expérimental qui vérifie la présence de llms.txt, donc la convention n'est pas morte, elle vise simplement les agents plutôt que la recherche.)
Alors, votre site devrait-il en avoir un ?
Une façon simple de décider :
- Vous avez de la documentation développeur, une API ou un produit orienté agents : oui. C'est peu coûteux, et l'écosystème des agents l'utilise vraiment.
- Vous gérez un site marketing ou de contenu et voulez des citations IA : ça ne fera pas de mal (c'est un fichier statique), mais n'en attendez pas de trafic, et ne le priorisez pas au-dessus d'un vrai travail de contenu.
- Vous manquez de temps : passez votre chemin et consacrez cette heure à quelque chose qui bouge l'aiguille.
Le cadrage honnête : llms.txt est peu coûteux, peu risqué, parfois utile, et largement survendu. Ajoutez-le s'il correspond à votre cas, mais réglez vos attentes sur les données, pas sur le battage.
Ce qui vous fait vraiment citer par l'IA (faites plutôt ceci)
Si le vrai but est d'apparaître dans les réponses IA, les leviers sont les mêmes que ceux qui ont toujours valu des citations : un contenu réellement utile, une structure claire que le modèle peut parser, et le fait d'être référencé par d'autres sources crédibles. Les moteurs IA lisent vos pages réelles, donc le travail se joue sur les pages, pas dans un manifeste que vous contrôlez.
Et il y a une étape que presque tout le monde saute : mesurer si tout cela fonctionne. Le trafic de référence IA est faible mais convertit bien, et l'essentiel se cache dans « Direct » parce que les outils IA suppriment le référent. Si vous ne voyez pas votre trafic IA, vous ne pouvez pas savoir si vos efforts GEO (llms.txt compris) servent à quoi que ce soit. Notre guide sur comment suivre le trafic IA de ChatGPT, Perplexity et Gemini explique exactement comment le faire remonter.
Comment Sublim aide
Sublim classe les visites venues d'assistants IA comme leur propre source d'acquisition au lieu de les jeter dans Direct, et il capture le référent complet partout où il existe. Parce qu'il est sans cookie, il compte aussi les visiteurs qu'un outil bloqué par le consentement perd, et il n'échantillonne jamais un canal aussi petit que les références IA. Ainsi, quand vous testez des tactiques GEO, vous pouvez réellement mesurer si elles apportent des visites et si ces visiteurs convertissent. Cela transforme « devrais-je ajouter llms.txt ? » d'une supposition en un chiffre que vous pouvez surveiller.



