Alle Tools laufen in deinem Browser — deine Dateien verlassen nie dein Gerät.
All tools154

Design

Robots.txt- und llms.txt-Generator

robots.txt und llms.txt bauen, mit Vorlagen für alle Crawler.

Was es macht. Die robots.txt liegt im Wurzelverzeichnis und sagt Crawlern, welche Bereiche sie abrufen dürfen. Sie ist eine Bitte, keine Sperre. Die neuere llms.txt richtet sich an KI-Systeme und beschreibt, welche Inhalte für die Verarbeitung durch Sprachmodelle bereitstehen.
Läuft im BrowserKein UploadKeine AnmeldungFunktioniert offline

So benutzt du Robots.txt- und llms.txt-Generator

  1. Wähl aus, welche Crawler zugelassen und welche ausgeschlossen sein sollen.
  2. Trag Pfade ein, die nicht abgerufen werden sollen, und die Adresse deiner Sitemap.
  3. Lade robots.txt und optional llms.txt herunter und leg sie ins Wurzelverzeichnis.

Welche Crawler zulassen?

Die Frage teilt sich in zwei: klassische Suchmaschinen und KI-Systeme.

Bei Suchmaschinen ist die Antwort einfach — alle zulassen. Googlebot und Bingbot auszusperren heißt, auf Sichtbarkeit zu verzichten.

Bei KI-Crawlern ist es eine Abwägung. GPTBot, ClaudeBot, PerplexityBot und Google-Extended lesen Inhalte für Training und für Antworten mit Quellenangabe. Wer sie aussperrt, schützt seine Inhalte vor der Verwendung im Training — und verzichtet zugleich darauf, in KI-Antworten als Quelle genannt zu werden.

Für ein Werkzeug- oder Ratgeberangebot spricht viel für Zulassen: Eine Nennung in einer KI-Antwort funktioniert wie ein Suchergebnis und bringt Besucher. Für ein Angebot, das von exklusiven Inhalten lebt, kann die Rechnung anders ausfallen.

Zu beachten ist die Trennung: Google-Extended steuert die KI-Nutzung, ohne die normale Suchindexierung zu beeinflussen. Beides lässt sich getrennt entscheiden.

Was robots.txt nicht kann

Der größte Irrtum: Sie verhindert keine Indexierung und schützt nichts.

Eine per robots.txt gesperrte Seite kann trotzdem im Index landen, wenn andere Seiten darauf verlinken — Google zeigt dann einen Eintrag ohne Beschreibung. Wer eine Seite wirklich aus dem Index halten will, braucht ein noindex im Head oder als HTTP-Header. Und das setzt voraus, dass die Seite abgerufen werden darf: Eine per robots.txt gesperrte Seite kann Google nicht lesen und damit auch das noindex nicht sehen.

Als Zugriffsschutz taugt sie ebenfalls nicht. Die Datei ist öffentlich lesbar und listet damit genau die Pfade auf, die interessant sein könnten. Ein Verzeichnis /admin/ dort einzutragen ist eher ein Hinweis als ein Schutz.

Und sie bindet niemanden. Seriöse Crawler halten sich daran, weil sie es wollen. Wer Inhalte gegen den Willen des Betreibers abgreift, liest die Datei allenfalls, um zu wissen wo es sich lohnt.

Häufige Fehler

Vier Fehler machen den Großteil der Probleme aus, die in der Search Console auftauchen.

Erstens: Disallow: / aus einer Testumgebung übernommen. Das sperrt die gesamte Website und ist die teuerste Zeile, die eine robots.txt enthalten kann.

Zweitens: CSS und JavaScript sperren. Google rendert Seiten und braucht dafür die Ressourcen. Sind sie gesperrt, wird die Seite falsch bewertet.

Drittens: der falsche Ort. Die Datei muss unter /robots.txt im Wurzelverzeichnis liegen. In einem Unterverzeichnis wird sie nicht gelesen, und für jede Subdomain braucht es eine eigene.

Viertens: Groß- und Kleinschreibung. Pfade sind auf den meisten Servern schreibungsabhängig, /Admin/ und /admin/ sind zwei verschiedene Regeln.

Häufige Fragen

Verhindert robots.txt die Indexierung?

Nein. Eine gesperrte Seite kann über eingehende Links trotzdem im Index landen. Dafür brauchst du noindex.

Soll ich KI-Crawler zulassen?

Für Ratgeber- und Werkzeugangebote meist ja — Nennungen in KI-Antworten bringen Besucher. Bei exklusiven Inhalten kann es anders sein.

Was ist llms.txt?

Eine Datei, die KI-Systemen in strukturierter Form sagt, welche Inhalte zur Verfügung stehen. Neu und nicht verbindlich.

Wohin gehört die Datei?

Ins Wurzelverzeichnis, als /robots.txt. Jede Subdomain braucht eine eigene.

Kann ich damit Bereiche schützen?

Nein. Die Datei ist öffentlich lesbar und benennt gerade die Pfade, die man verbergen wollte.

Muss ich die Sitemap eintragen?

Nötig ist es nicht, sinnvoll schon. Eine Zeile mit der vollständigen Adresse genügt.

Ratgeber zu Robots.txt- und llms.txt-Generator