Robots.txt
robots.txt ist eine Textdatei, die im Stammverzeichnis einer Website platziert wird und Suchmaschinen-Crawler anweist, welche Seiten oder Dateien sie anfordern dürfen oder nicht. Sie ist die erste Verteidigungslinie bei der Steuerung der Interaktion von Bots mit Ihrer Website-Infrastruktur und hilft bei der Optimierung des Crawl-Budgets.
Bots zu Ihren besten Inhalten leiten
Google weist Ihrer Website ein begrenztes "Crawl-Budget" zu – die Anzahl der Seiten, die seine Bots pro Tag crawlen werden. Wenn Bots Zeit mit dem Crawlen von Admin-Panels, doppelten druckfreundlichen Seiten oder Warenkorb-/Kassen-URLs verschwenden, verpassen sie möglicherweise Ihre wertvollen übersetzten Produktseiten. robots.txt weist Bots an: "Verschwenden Sie keine Zeit mit /admin/, konzentrieren Sie sich stattdessen auf /en/, /fr/, /de/". Für internationale Websites sollten Sie das Crawlen von Seiten mit automatischer Spracherkennungsumleitung, API-Endpunkten und allen technischen URLs, die nicht indexiert werden müssen, verbieten. Blockieren Sie jedoch NIEMALS versehentlich Ihre Sprachverzeichnisse – das ist ein katastrophaler Fehler, der jegliches internationales SEO zunichtemacht.
Crawling-Zugriff erlauben vs. verbieten
Auswirkungen in der realen Welt
Website hat keine robots.txt, Bots crawlen 10.000 Warenkorb-URLs
Crawl-Budget verschwendet, Produktseiten werden langsam gecrawlt
Neue Produkte erscheinen erst nach Wochen in der Suche
robots.txt hinzufügen: Disallow /cart/, /checkout/, /api/
Bots konzentrieren sich zu 100 % auf Produkt- und Sprachseiten
Neue Produkte werden innerhalb von 24 Stunden indexiert