aslain.dev
0%
01 Hizmetler 02 Hakkımda 03 Projeler 04 Stack 05 Blog 06 İletişim
← Tüm makaleler SEO & Marketing

robots.txt richtig nutzen: Aufbau und häufige Fehler

Eine robots txt-Datei ist eine kleine, aber entscheidende Textdatei, die Suchmaschinen-Bots mitteilt, welche Teile deiner Website sie crawlen dürfen. Richtig geschrieben schützt sie dein Crawl-Budget und verhindert, dass Bots Zeit mit nutzlosen Seiten verschwenden; falsch geschrieben kann sie deine gesamte Website für Google sperren und deinen organischen Traffic über Nacht auslöschen. Deshalb gehört diese scheinbar simple Datei zu den fehleranfälligsten Stellen im technischen SEO.

Was macht robots.txt eigentlich?

robots.txt steuert ausschließlich das Crawling-Verhalten, nicht das Indexieren. Diese Unterscheidung ist wichtig. Die Datei liegt im Stammverzeichnis deiner Website, unter https://deineseite.de/robots.txt. Bevor ein Bot eine URL anfragt, liest er diese Datei und wendet die für ihn geltenden Regeln an. Der Standard wurde als RFC 9309 (Robots Exclusion Protocol) formalisiert.

Das häufigste Missverständnis lautet: „Wenn ich eine Seite in robots.txt sperre, fällt sie aus Google heraus.“ Falsch. robots.txt verhindert keine Indexierung; sie verhindert nur, dass der Inhalt gelesen wird. Eine Seite, die vom Crawling ausgeschlossen, aber von anderen Seiten verlinkt ist, kann weiterhin in den Suchergebnissen erscheinen — mit dem Hinweis „Für diese Seite sind keine Informationen verfügbar“. Um eine Seite vollständig aus den Ergebnissen zu entfernen, verwende ein noindex-Meta-Tag oder einen HTTP-Header — und sperre diese Seite nicht in robots.txt, denn der Bot muss die Seite crawlen können, um die noindex-Anweisung zu sehen.

Grundstruktur und Direktiven

Die Datei ist reiner Text (UTF-8) und wird in Gruppen gelesen. Jede Gruppe beginnt mit einer User-agent-Zeile:

User-agent: *
Disallow: /admin/
Disallow: /warenkorb/
Allow: /admin/global.css

Sitemap: https://deineseite.de/sitemap.xml
  • User-agent: gibt an, für welchen Bot die Regel gilt. * bedeutet alle Bots. Für einen bestimmten Bot schreibst du z. B. Googlebot.
  • Disallow: verbietet das Crawlen von URLs, die mit dem angegebenen Pfadpräfix beginnen. Disallow: / sperrt die gesamte Website; ein leeres Disallow: blockiert nichts.
  • Allow: schafft eine Ausnahme innerhalb einer Disallow-Regel. Bei Google gewinnt die längste (spezifischste) passende Regel.
  • Sitemap: gibt die vollständige URL deiner Sitemap an. Sie ist unabhängig von den Gruppen und kann an beliebiger Stelle der Datei stehen.

Google unterstützt das Platzhalterzeichen * (beliebige Zeichenfolge) und $, um das Ende einer URL zu verankern. Zum Beispiel, um alle PDF-Dateien zu sperren:

User-agent: *
Disallow: /*.pdf$

Häufige Fehler und ihre Folgen

Fehler in dieser Datei sind leise: Die Website funktioniert weiter, aber über Monate erodiert dein Traffic. Die häufigsten:

  • Versehentlich die ganze Website sperren. Beim Wechsel von der Staging- zur Produktionsumgebung die Zeile Disallow: / nicht zu entfernen, ist die klassische Katastrophe. Steht diese Zeile auf der Live-Website, stoppt Google das Crawlen.
  • CSS und JavaScript sperren. Eine Regel wie Disallow: /assets/ hindert Google daran, die Seite korrekt zu rendern. Google zeichnet die Seite wie ein Browser; ohne Zugriff auf Stile und Skripte beurteilt es deine Mobilfreundlichkeit und dein Layout falsch.
  • robots.txt für ein Indexierungswerkzeug halten. Sensible Ressourcen (z. B. /geheimer-bericht.pdf) hier aufzulisten, legt sie erst recht offen — die Datei ist öffentlich und liefert Neugierigen ein Verzeichnis der Pfade. Um den Zugriff wirklich zu beschränken, nutze Authentifizierung oder Schutz auf Serverebene.
  • Groß-/Kleinschreibung übersehen. Pfade sind case-sensitiv: /Seite und /seite gelten als verschieden.
  • Einen 5xx-Fehler zurückgeben. Liefert robots.txt einen Serverfehler, kann Google dies vorübergehend als „alles verboten“ interpretieren und das Crawlen verlangsamen. Ein 404 wird hingegen als „alles erlaubt“ behandelt.

Crawl-delay und andere missverstandene Direktiven

Die Direktive Crawl-delay wird von Google nicht unterstützt und ignoriert, auch wenn Suchmaschinen wie Bing und Yandex sie beachten. Möchtest du die Crawl-Rate von Googlebot steuern, tue das über die Search Console oder indem du deine Serverantwortzeiten verbesserst. Ebenso funktionierte die Direktive Noindex: eine Zeit lang inoffiziell, doch Google hat die Unterstützung 2019 entfernt — sie funktioniert nicht mehr. Der einzige korrekte Weg, die Indexierung zu blockieren, ist ein <meta name="robots" content="noindex"> auf Seitenebene oder ein X-Robots-Tag HTTP-Header.

Deine Datei testen

Validiere immer vor dem Livegang. Ein praktischer Ansatz:

  • Der robots.txt-Bericht in der Google Search Console zeigt, welche Version der Datei Google sieht und ob sie Fehler enthält.
  • Prüfe mit dem Live-Tool zur URL-Prüfung, ob eine bestimmte URL gesperrt ist.
  • Öffne die Datei nach einer Änderung direkt im Browser (/robots.txt), um zu bestätigen, dass sie wirklich das zurückgibt, was du erwartest; Cache oder Weiterleitungen liefern manchmal eine alte Version.

Halte sie klein und einfach. Für die meisten Websites ist eine klare Datei mit zehn Zeilen weitaus sicherer als eine wuchernde Struktur mit hundert Zeilen. Je weniger Ausnahmen, desto geringer das Fehlerrisiko.

Häufige Fragen

Wird meine Website ohne robots.txt gecrawlt?

Ja. robots.txt ist nicht verpflichtend; fehlt die Datei, behandeln Bots alles als crawlbar. Dennoch ist es eine gute Gewohnheit, selbst eine leere Datei vorzuhalten, um deine Sitemap anzugeben und bei Bedarf Regeln hinzuzufügen.

Kann ich eine Seite mit robots.txt und noindex zugleich sperren?

Nein, verwende beides nicht gemeinsam. Sperrst du die Seite in robots.txt, kann der Bot nicht hinein und sieht das noindex-Tag nicht, sodass die Seite indexiert bleiben kann. Um die Indexierung zu blockieren, lass die Seite crawlbar und verwende nur noindex.

Wie lange dauert es, bis eine Änderung wirkt?

Google speichert robots.txt in der Regel etwa 24 Stunden im Cache. Hast du eine dringende Korrektur vorgenommen, kannst du in der Search Console ein erneutes Crawlen anfordern; andernfalls wird sie innerhalb weniger Stunden automatisch aktualisiert.

Sind die Crawl-Einstellungen deiner Website außer Kontrolle geraten? Wenn du deine robots.txt, Sitemap und Indexierung von Anfang bis Ende prüfen und auf eine sichere Basis stellen lassen möchtest, nimm Kontakt mit mir auf.

Bu kategorideki tüm yazılar →

Devamı için