Ihre Texte, fremdes Training.
Jeder Betreiber kann entscheiden, ob KI-Anbieter seine Inhalte einsammeln dürfen. Nur sollte man wissen, was man damit tatsächlich abschaltet.
Die Frage kommt inzwischen regelmäßig: „Kann ich verhindern, dass die KI meine Texte klaut?" Teilweise — und es hat Nebenwirkungen, die man vorher kennen sollte.
Wichtig ist die Unterscheidung zwischen drei verschiedenen Dingen, die gern verwechselt werden: Training, Antwortsuche und normale Suche.
Drei Arten von Zugriff
1. Training. Ein Anbieter sammelt Inhalte ein, um damit ein Modell zu trainieren. Ihre Texte landen nicht als Text im Modell, aber ihr Inhalt prägt es mit. Das lässt sich über die robots.txt steuern.
2. Abruf zur Antwortzeit. Ein KI-Dienst ruft Ihre Seite in dem Moment ab, in dem jemand eine Frage stellt, und zitiert sie mit Quellenangabe. Das bringt Ihnen Sichtbarkeit und teils echte Besucher — hier zu sperren schadet eher.
3. Normale Suche. Der klassische Suchmaschinen-Crawler. Wer den sperrt, verschwindet aus Google.
Der entscheidende Punkt: Google verwendet für AI Overviews den normalen Suchindex. Die Sperre für KI-Training bei Google hindert Google nicht daran, Ihre Seite in einer KI-Antwort zu verwenden. Entweder Sie sind in der Suche, dann auch dort — oder gar nicht.
Die Einträge in der robots.txt
Gesteuert wird über den Namen des jeweiligen Crawlers. Die bekanntesten:
- GPTBot — OpenAI, Einsammeln für Training
- Google-Extended — Google, Nutzung für KI-Modelle; beeinflusst die normale Suche nicht
- ClaudeBot — Anthropic
- PerplexityBot — Perplexity
- CCBot — Common Crawl, ein frei verfügbarer Datensatz, aus dem sich viele bedienen
- Applebot-Extended — Apple, KI-Nutzung
- Bytespider — ByteDance
Ein Eintrag sieht dann so aus, je Crawler ein Abschnitt mit User-agent: und Disallow: /. Wichtig: Die Namen ändern sich, es kommen neue dazu, und die robots.txt ist eine Bitte, keine Sperre. Wer sich nicht daran hält, wird dadurch nicht aufgehalten.
Was llms.txt ist — und was nicht
Seit einiger Zeit kursiert der Vorschlag einer Datei llms.txt: eine Art Inhaltsverzeichnis in einfacher Form, das KI-Systemen zeigt, was auf der Seite steht und was davon wichtig ist.
Die Idee ist nicht verkehrt. Nur: Es ist ein Vorschlag, kein verabschiedeter Standard, und die großen Anbieter haben bislang nicht erklärt, dass sie ihn offiziell auswerten. Wer eine solche Datei anlegt, tut nichts Falsches — aber niemand sollte dafür Geld ausgeben oder sich davon Platzierungen versprechen.
Unsere Haltung: Pflegen Sie lieber die Seite selbst ordentlich. Saubere Überschriften, klare Antworten und strukturierte Daten wirken heute, eine Datei auf Verdacht vielleicht morgen.
Sperren oder nicht — die Abwägung
Für das Sperren spricht: Wenn Ihre Inhalte Ihr Produkt sind — Fachtexte, Bauanleitungen, Rezepte, Datenbanken —, ist es nachvollziehbar, sie nicht für fremdes Training bereitzustellen.
Dagegen spricht: Für einen Handwerksbetrieb, eine Werkstatt oder eine Agentur sind die eigenen Seiten keine Ware, sondern Werbung. Wer gefunden werden will, schließt sich nicht aus den Systemen aus, in denen immer mehr Leute suchen.
Unser Mittelweg: Training aussperren, wo es nichts bringt (reine Trainingsbots wie CCBot und GPTBot), die abrufenden Dienste mit Quellenangabe dagegen hereinlassen. Und in jedem Fall prüfen, ob die Sperre nicht versehentlich die normale Suche mit trifft.
Was wirklich hilft, wenn Inhalte übernommen werden
Die robots.txt schützt nicht vor dem Kopieren durch Menschen oder unseriöse Anbieter. Was in diesen Fällen zählt, ist Urheberrecht — und dafür braucht es Nachweise: Wann wurde der Text veröffentlicht, von wem?
Ein Blick in die Protokolle Ihres Servers zeigt übrigens, welche Crawler tatsächlich bei Ihnen vorbeikommen. Das ist aufschlussreicher als jede Liste im Internet, weil es Ihre Seite betrifft und nicht irgendeine.
Häufige Rückfragen.
Wir sehen es uns an.
Kurze Frage oder ganzes Vorhaben — das Erstgespräch kostet nichts, auch wenn daraus kein Auftrag wird.