robots.txt, llms.txt, Sitemaps und Header sind Hygiene. Sie sagen Crawlern, was sie lesen dürfen. Sie sind kein Ticket in ChatGPT, Gemini oder irgendeinen Allocator.
Erreicht ein Bot die Seite nicht, macht kein FAQ-Spam das Modell euch zitieren. Zuerst Dateizugang. Dann extrahierbare Fakten. Dann neu messen.
llms.txt ist eine öffentliche Karte — ein Höflichkeitsdokument. Manche Retriever schauen. Manche ignorieren es. Es als Ranking-Hebel zu verkaufen, so lügt die Kategorie. Wir inventarisieren, was ihr ausliefert, und labeln Abweichungen: eine Sitemap, die robots widerspricht, ein Header, der den eingeladenen Bot blockt, HTML, das nicht das HTML ist, das ein Mensch sieht.
Dasselbe öffentliche HTML für Menschen und Crawler. Kein Cloaking. Kein User-Agent-Fork. Das ist Produktgesetz, keine Stimmung. Discover — eine URL einreichen, einen Pfad öffnen — ist keine Zitat-Garantie. Es ist die Chance, gelesen zu werden.
Agent-Analytics, wenn wir sie zeigen, kommt aus Logs, die ihr schon habt. Training-Traffic, Retrieval-Fetches und Indexing-Hits sind verschiedene Jobs. Sie zu „KI-Traffic“ zu mischen ist wieder ein Nebelwort.
Ein token-leichtes Payload für Agenten, menschliches HTML unverändert, ist eine spätere Idee in diesem Stack. Das ist kein Cloaking. Es ist auch nicht im v1-Angebot. Kauft keine Story von einer unsichtbaren zweiten Site.
Die ehrliche Sequenz ist langweilig, deshalb funktioniert sie: kann der Bot holen, kann ein Mensch den Span zitieren, hat der nächste Monatsschnitt sich bewegt. Hygiene, nicht Folklore.