Wie muss der perfekte robots.txt aussehen ?

  • Trotz vieler Suche und Recherche im Forum, kann ich keinen umfassenden Beitrag zum robots.txt finden. Da dieser aber für eine Vermeidung von doppeltem Content bei google sehr wichtig ist, erscheint mir eine Zusammenfassung notwendig. Auch in einigen Wordpress Büchern, wird nicht darauf eingegangen, obwohl dies für eine erfolgreiche Installation, soll heissen, Blog wird in Suchmaschinen richtig gelistet doch, unentbehrlich ist.
    Auch auf der Wordpress Seite findet man keinen Basis-Beitrag zu diesem Thema? Man muss irre viel durchsuchen und macht dann doch fatale Fehler.

    Auch ist bei den Wordpress Installationen kein robots.txt dabei.

    Definitionen des robots.txt findet man hier....
    und eine Beschreibung bei wikipedia findet sich dort....
    Diese robots.txt datei ist also eine reine ASCII Datei und muss im root Verzeichnis eines Blogs liegen.

    Kein Problem hat man, wenn man keine Suchmaschine auf der Seite haben will. Hier kann der robots.txt folgendermaßen aussehen:

    User-Agent: *
    Disallow:

    Man kann dies auch erreichen, indem man bei der Installation anklickt, dass es sich um einen privaten Blog handelt, der nicht öffentlich in Suchmaschinen auftauchen soll.

    Jetzt aber zur Standard Installation von Wordpress mit einem öffentlichen Blog. Die Seiten die in einen Blog geschrieben werden, werden von Wordpress ja mehrfach verwaltet. Soll heissen diese Seiten werden einmal einem author zugeordnet, einer categorie, neuerdings tags und die Seiten werden in einem Archiv abgelegt oder einem RSS Feed veröffentlicht. Es handelt sich dabei ja immer um den gleichen Content. Lässt man den google crawler uneingeschränkt auf diese Struktur los, läuft man Gefahr, dass doppelter Content entdeckt wird und google bestraft dies häufig indem der Inhalt einfach aus dem Index fliegt.

    Also muss dies vermieden werden. Im wesentlichen erfolgt dies durch einen Disallow Eintrag.

    Hier ein Beispiel eines robots.txt, wie er nach unserer Recherche aussehen sollte:

    sitemap: http://www.meinblog.de/sitemap.xml
    User-agent: *
    Disallow: /wp-admin/
    Disallow: /wp-includes/
    Disallow: /wp-content/
    Disallow: /author/
    Disallow: */page/ *
    Disallow: /images/
    Disallow: /backup/
    Disallow: /banners/
    Disallow: */trackback/
    Disallow: */feed/
    Disallow:*/?feed=*
    Disallow: /*?*
    Disallow: */wp-trackback.php*
    Disallow: /wp-login.php
    Allow: /?feed=*
    Allow: /feed/
    User-agent: Googlebot-Image
    Allow: /wp-content/uploads/
    User-agent: Mediapartners-Google
    Allow: /

    Erklärung:
    [Zeile 1] Es wird darauf verwiesen, dass eine sitemap.xml existiert.
    [Zeile 2] Definiert den angesprochenen Bot, mit * werden als Platzhalter alle angesprochen.
    [Zeile 3 - Zeile 5] schliesst die Basis Ordner von Wordpress aus.
    [Zeile 6] schliesst die Zusammenfassung der Beiträge nach Autoren aus.
    [Zeile 7] schliesst die statischen Seiten aus. Will man eine spezielle statische Seite erlauben kann man die mit einem Allow: dem Crawler zugänglich machen.
    [Zeil 8-10] damit werden Ordner auf dem Server ausgeschlossen, die neben der Wordpress Installation liegen.
    [Zeile 11] damit werden alle trackback URLs ausgeschlossen.
    [Zeile 12-14] damit werden die feeds rausgenommen
    [Zeile 15] samit werden trackback Aufrufe rausgenommen
    [Zeile 16] nimmt das login-Formular raus, komischweise wird das sonst gerne von google indiziert.
    [Zeile 17-18] mit Allow: werden dann spezielle Seiten dem Crawler freigegeben.
    [Zeile 19-22] es werden weitere Bots angesprochen.

    Tja soweit so gut, erscheint ja alles logisch, aber trotzdem haben wir das Problem, dass die einzelnen Seiten nicht sauber von google erfasst werden !
    Auch werden die Seiten nicht von der Google Blog Suche erfasst, obwohl der entsprechende Ping Service eingetragen ist.

    Gibt es da noch weitere Zusätze? Auf was muss geachtet werden ? Für Anregungen und Ergänzungen wäre ich sehr dankbar, damit dieses Thema robots.txt endlich einmal umfassend gelöst wird.

    • Anzeige

    Hallo!

    Wenn du gerade an deiner Website arbeitest oder dein aktuelles Hosting überdenkst: Wir betreiben mit NetzLiving eine Hosting-Plattform, die speziell auf Performance, Sicherheit und einfache Verwaltung ausgelegt ist.

    • ✔️ Schnelle Ladezeiten (optimiert für WordPress & Co.)
    • ✔️ Deutsche Server & DSGVO-konform
    • ✔️ Persönlicher Support (kein 0815-Ticket-System)

    Mehr erfahren

  • Google indiziert feeds sowieso nicht mehr im normalen Index,also muss man sie auch nicht mehr aktiv ausschließen,

    die robots.txt ist ja eher das Thema von SEO Foren, darum auch hier kaum info daürber,

    lg

  • Hi zusammen.

    Mich würde das auch sehr interessieren, beim googlen wird man mit hinweisen ja quasi überschüttet...

    Also, ich habe das für mich jetzt so gelöst:

    Außerdem habe ich noch diesen "Patch" eingebunden -> http://seofreak.de/upload/nofollowpatch.php.txt

    Ist das ganze so ok?

    Einmal editiert, zuletzt von Friedel (28. Februar 2008 um 12:45)

  • man brauch eigentlich nur sehr wenig in die robots.txt einfügen!
    nicht alles erwähnen, sondern wirklich nur das, was nicht indiziert werden soll!

    Zitat

    User-agent: *
    Disallow:

    Impressum | Disclaimer: http://www.bsp.com/disclaimer/
    ...

    das reicht eigentlich schon!
    die ganzen sachen in wp-admin werden eh nicht durchsucht und die feeds auch nicht!

    also nur auf das nötigste beschränken, damit die bots es einfach haben!

  • also nur auf das nötigste beschränken, damit die bots es einfach haben!

    Das sehe ich auch so. Feeds kann man herausnehmen. Nen Tipp wäre noch Suchergebnisse nicht indizieren zu lassen.

    Ich mag keine Statischen Seiten im Index, keine Suchanfragen und Trackbacks.

    BIn mir aber nicht sicher, ob Trackback URLs als DC gezählt werden: Weiss das jemand?

  • Hast Du schon mal eine Trackback-Adresse irgendwo in den Suchergebnissen gesehen?
    Ich nicht. Das liegt einfach daran, das der Aufruf der Trackbackadresse als Link einfach wieder ein Redirect auf den eigentlichen Artikel bewirkt. Ist also kein Problem.

    Gruß
    Ingo

    Wenn ich helfen konnte, bitte [ Gefällt mir ] klicken. :-)

  • Bin ja auch erst 4 Wochen dabei..

    Und warum nutzt man dann Trackback-URLS und nicht die original-URL beim Schreiben von Beiträgen?

  • Also für sowas würd ich jetzt nicht wirklich ein Plugin einsetzen..

Jetzt mitmachen!

Sie haben noch kein Benutzerkonto auf unserer Seite? Registrieren Sie sich kostenlos und nehmen Sie an unserer Community teil!