Warum erscheint meine URL in der Suche, obwohl sie in der robots.txt gesperrt ist?
Weil „nicht abrufen" etwas anderes heißt als „nicht anzeigen". Das ist kein Fehler, sondern eine Eigenschaft des Verfahrens.
Warum das passiert
Eine typische Sperre sieht so aus:
User-agent: *
Disallow: /meine-bilder-und-pdfs/
Sie sagt: Ruf dieses Verzeichnis nicht ab. Sie sagt nicht: Zeig es nicht an. Das sind zwei verschiedene Dinge, und genau darin liegt das Missverständnis.
Google hält sich an die Sperre und ruft nichts ab. Wenn aber von anderen Seiten Links auf diese Adresse zeigen, weiß Google trotzdem, dass es sie gibt – und schließt daraus, dass sie jemanden interessiert. Dann erscheint sie in den Ergebnissen: mit der nackten Adresse und ohne Beschreibung, weil ja nichts gelesen werden durfte.
Die Lösung – und der Schritt, der oft fehlt
Die übliche Empfehlung lautet: die Seiten im gesperrten Verzeichnis
einfach mit noindex versehen. Dabei fehlt der
entscheidende Schritt.
So gebaut wirkt es nämlich nicht: Solange das Verzeichnis in der
robots.txt gesperrt ist, darf Google es nicht abrufen –
und findet das noindex darin deshalb nie. Die Sperre
muss weg, damit die Kennzeichnung gelesen werden
kann.
Richtig ist also diese Reihenfolge:
-
Die Sperre aus der
robots.txtentfernen. Klingt verkehrt herum, ist aber der einzige Weg. -
Auf den betroffenen Seiten
noindexsetzen:<meta name="robots" content="noindex, follow"> - In der Search Console unter „Entfernungen" die Adresse vorübergehend ausblenden – das überbrückt die Zeit, bis Google wieder vorbeischaut.
- Wenn die Adressen nach einigen Wochen verschwunden sind, kann die Sperre zurück. Nötig ist sie dann aber nicht mehr.
Bei PDFs und Bildern geht das anders
Eine PDF-Datei oder ein Bild hat keinen <head> – ein
Meta-Tag lässt sich dort gar nicht unterbringen. Genau darum ging es
aber im Beispiel oben.
Für solche Dateien gibt es die Kennzeichnung als
HTTP-Kopfzeile. In der .htaccess:
<FilesMatch "\.pdf$">
Header set X-Robots-Tag "noindex, follow"
</FilesMatch>
Das wirkt genauso wie das Meta-Tag, nur eben für Dateien, die keinen HTML-Kopf haben. Auch hier gilt: Die Datei muss abrufbar bleiben, sonst liest niemand die Kopfzeile.
Bevor du an der .htaccess arbeitest: eine Kopie
anlegen. Ein Tippfehler dort legt die ganze Website lahm. Der
.htaccess-Generator erklärt, wie
du dich absicherst.
Der Merksatz
Wer eine Seite aus der Suche haben will, muss sie lesbar lassen. Die Kennzeichnung steht in der Seite – und was gesperrt ist, wird nicht gelesen.
Die robots.txt regelt Höflichkeit gegenüber dem Server,
nicht die Sichtbarkeit. Wofür sie tatsächlich taugt, steht im
robots.txt-Generator.
Passt das nicht auf deinen Fall?
Dieser Artikel beantwortet die Frage allgemein – deine ist vermutlich konkreter. Schreib mir kurz, worum es geht. Ich antworte selbst, meist am selben Tag, und es kostet nichts.
Hat dir das geholfen?
Dann sag es weiter. Eine kurze Bewertung dauert dreißig Sekunden und sorgt dafür, dass die Nächsten diese Antwort überhaupt finden.
Passt dazu
- SEO Der noindex-Tag Die einzige zuverlässige Art, eine Seite aus den Suchergebnissen zu halten – und der häufigste Grund, warum sie es trotzdem nicht tut.
- SEO Was bedeutet „crawl-delay" in der robots.txt? Eine Bremse für Suchmaschinen – die der wichtigste Empfänger einfach ignoriert.
- SEO Was bedeutet SEO? Suchmaschinenoptimierung – alles, was dafür sorgt, dass deine Website gefunden wird, wenn jemand nach dem sucht, was du anbietest.
- SEO Wie wird man online sichtbarer? Sichtbarkeit entsteht nicht aus einer Maßnahme, sondern aus mehreren, die zusammenpassen. Hier stehen sie in der Reihenfolge, in der sie sich lohnen.