Trotz vieler Suche und Recherche im Forum, kann ich keinen umfassenden Beitrag zum robots.txt finden. Da dieser aber für eine Vermeidung von doppeltem Content bei google sehr wichtig ist, erscheint mir eine Zusammenfassung notwendig. Auch in einigen Wordpress Büchern, wird nicht darauf eingegangen, obwohl dies für eine erfolgreiche Installation, soll heissen, Blog wird in Suchmaschinen richtig gelistet doch, unentbehrlich ist.
Auch auf der Wordpress Seite findet man keinen Basis-Beitrag zu diesem Thema? Man muss irre viel durchsuchen und macht dann doch fatale Fehler.
Auch ist bei den Wordpress Installationen kein robots.txt dabei.
Definitionen des robots.txt findet man hier....
und eine Beschreibung bei wikipedia findet sich dort....
Diese robots.txt datei ist also eine reine ASCII Datei und muss im root Verzeichnis eines Blogs liegen.
Kein Problem hat man, wenn man keine Suchmaschine auf der Seite haben will. Hier kann der robots.txt folgendermaßen aussehen:
User-Agent: *
Disallow:
Man kann dies auch erreichen, indem man bei der Installation anklickt, dass es sich um einen privaten Blog handelt, der nicht öffentlich in Suchmaschinen auftauchen soll.
Jetzt aber zur Standard Installation von Wordpress mit einem öffentlichen Blog. Die Seiten die in einen Blog geschrieben werden, werden von Wordpress ja mehrfach verwaltet. Soll heissen diese Seiten werden einmal einem author zugeordnet, einer categorie, neuerdings tags und die Seiten werden in einem Archiv abgelegt oder einem RSS Feed veröffentlicht. Es handelt sich dabei ja immer um den gleichen Content. Lässt man den google crawler uneingeschränkt auf diese Struktur los, läuft man Gefahr, dass doppelter Content entdeckt wird und google bestraft dies häufig indem der Inhalt einfach aus dem Index fliegt.
Also muss dies vermieden werden. Im wesentlichen erfolgt dies durch einen Disallow Eintrag.
Hier ein Beispiel eines robots.txt, wie er nach unserer Recherche aussehen sollte:
sitemap: http://www.meinblog.de/sitemap.xml
User-agent: *
Disallow: /wp-admin/
Disallow: /wp-includes/
Disallow: /wp-content/
Disallow: /author/
Disallow: */page/ *
Disallow: /images/
Disallow: /backup/
Disallow: /banners/
Disallow: */trackback/
Disallow: */feed/
Disallow:*/?feed=*
Disallow: /*?*
Disallow: */wp-trackback.php*
Disallow: /wp-login.php
Allow: /?feed=*
Allow: /feed/
User-agent: Googlebot-Image
Allow: /wp-content/uploads/
User-agent: Mediapartners-Google
Allow: /
Erklärung:
[Zeile 1] Es wird darauf verwiesen, dass eine sitemap.xml existiert.
[Zeile 2] Definiert den angesprochenen Bot, mit * werden als Platzhalter alle angesprochen.
[Zeile 3 - Zeile 5] schliesst die Basis Ordner von Wordpress aus.
[Zeile 6] schliesst die Zusammenfassung der Beiträge nach Autoren aus.
[Zeile 7] schliesst die statischen Seiten aus. Will man eine spezielle statische Seite erlauben kann man die mit einem Allow: dem Crawler zugänglich machen.
[Zeil 8-10] damit werden Ordner auf dem Server ausgeschlossen, die neben der Wordpress Installation liegen.
[Zeile 11] damit werden alle trackback URLs ausgeschlossen.
[Zeile 12-14] damit werden die feeds rausgenommen
[Zeile 15] samit werden trackback Aufrufe rausgenommen
[Zeile 16] nimmt das login-Formular raus, komischweise wird das sonst gerne von google indiziert.
[Zeile 17-18] mit Allow: werden dann spezielle Seiten dem Crawler freigegeben.
[Zeile 19-22] es werden weitere Bots angesprochen.
Tja soweit so gut, erscheint ja alles logisch, aber trotzdem haben wir das Problem, dass die einzelnen Seiten nicht sauber von google erfasst werden !
Auch werden die Seiten nicht von der Google Blog Suche erfasst, obwohl der entsprechende Ping Service eingetragen ist.
Gibt es da noch weitere Zusätze? Auf was muss geachtet werden ? Für Anregungen und Ergänzungen wäre ich sehr dankbar, damit dieses Thema robots.txt endlich einmal umfassend gelöst wird.