robots.txt richtig nutzen
Die robots.txt ist eine öffentlich erreichbare Textdatei mit Regeln für Crawler. Kleine Fehler können wichtige Seiten vom Abruf ausschließen.
Verstehen Sie die Aufgabe
Eine Disallow-Regel kann einem Crawler mitteilen, dass ein Pfad nicht abgerufen werden soll. Das ist etwas anderes als ein noindex-Signal für eine abrufbare Seite. Eine gesperrte URL kann unter Umständen trotzdem über fremde Links bekannt werden. Verwenden Sie robots.txt daher nicht als Zugangsschutz für interne Dokumente. Für vertrauliche Inhalte brauchen Sie echte Zugriffskontrollen. Öffnen Sie die Datei unter /robots.txt und lesen Sie jede Regel daraufhin, ob sie öffentliche Leistungs- und Ratgeberseiten betrifft.
Prüfen Sie neue Bereiche
Nach einem Relaunch bleibt gelegentlich eine Sperre aus einer Testumgebung stehen. Wenn die gesamte Site auf Disallow gesetzt ist, können Crawler die Inhalte nicht normal erfassen. Bei neuen Blogverzeichnissen oder Assets kann eine alte Regel unerwartet greifen. Testen Sie wichtige URLs mit geeigneten Prüfwerkzeugen und sehen Sie in die Search Console. Eine Sitemap-Zeile in robots.txt kann beim Auffinden helfen, ist aber kein Freifahrtschein durch eine Sperre. Halten Sie die Regeln so einfach wie möglich.
Treffen Sie bewusste Bot-Entscheidungen
Verschiedene Dienste betreiben Crawler für unterschiedliche Zwecke. Lesen Sie deren aktuelle Dokumentation, bevor Sie benannte User Agents erlauben oder blockieren. Regeln für Googlebot, OAI-SearchBot und GPTBot sollten nicht aus fremden Vorlagen ungeprüft übernommen werden. Die technische Freigabe garantiert keine Aufnahme in Suchergebnisse. Dokumentieren Sie, warum Sie welche Bereiche sperren; so kann eine spätere Änderung an der Website die Entscheidung nachvollziehen.
Eine Regel mit Nebenwirkung
Eine Testsite hatte während der Entwicklung „Disallow: /“ gesetzt. Nach dem Umzug auf die Live-Domain blieb dieselbe robots.txt bestehen. Besucher konnten alle Seiten sehen, Crawler sollten sie jedoch nicht abrufen. Der Fehler fällt im Browser kaum auf. Legen Sie für einen Relaunch deshalb eine explizite Prüfung von robots.txt, noindex und Passwortschutz fest. Testen Sie nicht nur die Startseite, sondern auch eine Leistungs- und Ratgeberseite. Die Datei sollte bewusst auf die gewünschte Öffentlichkeit abgestimmt sein. Ein privater Entwurf braucht andere Regeln als eine veröffentlichte Website.
Weiterlesen: Google: Crawling und Indexierung
Kostenloser Check
Sie möchten wissen, wo Ihr Unternehmen online Anfragen verliert? Vier kurze Angaben, dann melden wir uns für ein kostenloses 10-Minuten-Gespräch.
Kostenlosen Check starten