robots.txt, llms.txt, sitemaps et en-têtes sont de l’hygiène. Ils disent aux crawlers ce qu’ils peuvent lire. Ce n’est pas un ticket ChatGPT, Gemini, ni l’allocateur de quiconque.
Si un bot n’atteint pas la page, aucun spam FAQ ne fera citer par le modèle. L’accès fichiers d’abord. Puis les faits extractibles. Puis remesurer.
llms.txt est une carte publique — un document de courtoisie. Certains retrievers regardent. D’autres l’ignorent. Le vendre comme levier de ranking, c’est ainsi que la catégorie ment. Nous inventarions ce que vous livrez et étiquetons les écarts : un sitemap qui contredit robots, un en-tête qui bloque le bot invité, un HTML qui n’est pas celui qu’une personne voit.
Le même HTML public pour les gens et les crawlers. Pas de cloaking. Pas de fourche selon l’user-agent. C’est la loi produit, pas une humeur. Découvrir — soumettre une URL, ouvrir un chemin — n’est pas une garantie de citation. C’est la chance d’être lu.
L’analytique agents, quand nous la montrons, vient de logs que vous avez déjà. Trafic d’entraînement, fetches de retrieval et hits d’indexation sont des métiers distincts. Les fondre en « trafic IA » est un autre mot brouillard.
Un payload léger en tokens pour les agents, HTML humain inchangé, est une idée plus tardive dans cette stack. Ce n’est pas du cloaking. Ce n’est pas non plus dans l’offre v1. N’achetez pas une histoire de second site invisible.
La séquence honnête est ennuyeuse, c’est pour ça qu’elle marche : le bot peut-il récupérer, une personne peut-elle citer le passage, la coupe mensuelle suivante a-t-elle bougé. Hygiène, pas folklore.