Was gehört in die robots.txt?

  • Hi,

    ich habe WP seit ca. 4-5 Wochen installiert und seit ein paar Tagen wird mein Blog auch bei Google gefunden,
    aber es werden auch ein paar Seiten gefunden die bei Google und Co. nix verloren haben z.B. wp-login.php und wp-register.php.

    Welche Dateien und Verzeichnisse, muss ich in die robots.txt "sperren" damit nur noch die Startseite, Beiträge, Statische Seiten, Kategorien und Archive gefunden werden?
    Ist es sinnvoll an die Hyperlinks, die nicht gefunden werden sollen, ein rel="nofollow"-Attribut einzufügen?

    • Anzeige

    Hallo!

    Wenn du gerade an deiner Website arbeitest oder dein aktuelles Hosting überdenkst: Wir betreiben mit NetzLiving eine Hosting-Plattform, die speziell auf Performance, Sicherheit und einfache Verwaltung ausgelegt ist.

    • ✔️ Schnelle Ladezeiten (optimiert für WordPress & Co.)
    • ✔️ Deutsche Server & DSGVO-konform
    • ✔️ Persönlicher Support (kein 0815-Ticket-System)

    Mehr erfahren

  • Zitat von ne-r-o

    aber es werden auch ein paar Seiten gefunden die bei Google und Co. nix verloren haben z.B. wp-login.php und wp-register.php.

    Keine Antwort auf deine Frage aber nur kurz: Eigentlich kein Problem, weil ohne Passwort kommt eh niemand in deinen Adminbereich und wenn du die Möglichkeit nicht per Admin erlaubst, kann sich auch niemand einfach so registrieren.

    METAFAKTEN // Netzgeschehen und freie Software

  • Impressum von Indexierung ausschließen

    Mich würde interessieren, wie ich mein Impressum von der Indexierung durch Google ausschließen kann. Ich habe es als »statische Seite« eingebaut. Es geht nur um den Ausschluss dieser einzigen Seite. Wie muss die betreffende Zeile in der Datei »robots.txt« lauten?

    Meine Passwörter verwalte ich mit KeePass.

  • ich verstehe nicht so ganz wo du da ein problem hast

    1) das indexieren kannst du am besten damit verhindern, dass du sie nicht verlinkst, dein login wirst du ach so finden, liegt ja eh immer unter /wp-admin/

    2) wenn es dir um sicherheit geht, würde ich dir empfehlen dein /wp-admin/ verzeichnis mit einem passwort zu schützen
    habe es noch nie bei wordpress gemacht, keine ahnung, ob das seiteneffekte hat

  • Zitat von alternative4

    google kümmert sich ohnehin herzlich wenig um die robot.txt


    das kann ich nicht bestätigen,
    jede meiner robots.txt Dateien wurde immer noch von Google respektiert.

    lg
    Monika

  • Zitat von Monika


    das kann ich nicht bestätigen,
    jede meiner robots.txt Dateien wurde immer noch von Google respektiert.

    lg
    Monika

    dann hast du glück. verlassen kann man sich darauf aber in keinem fall. google nimmt auch permanent änderungen an den eingesetzten verfahren vor, die niemand zu 100% durchschaut.
    außerdem gibt es ja nicht nur google.

    I woke up one morning and all of my stuff had been stolen…and replaced by exact duplicates.

  • Hallo Finanzen Tomate,

    ja das wird auch zeit. ich selber fahre z.b. zur zeit mit msn wesentlich besser als mit google.

    google übertreiben es in letzter zeit doch sehr mit ihrem monopol denken.

    I woke up one morning and all of my stuff had been stolen…and replaced by exact duplicates.

  • Google erkennt übrigens die robots.txt an.

    http://www.google.com/intl/de/webmasters/bot.html

    Zitat

    robots.txt ist ein Standarddokument, das Googlebot anweisen kann, keine oder nicht alle Informationen von Ihrem Webserver herunterzuladen. Das Format der robots.txt-Datei wird im Robot Exclusion Standard angegeben. Ausführliche Informationen dazu, wie Sie verhindern, dass Googlebot Ihre Website ganz oder teilweise durchsucht, finden Sie auf unserer Seite Entfernen.

    Nofollow natürlich auch:

    Zitat

    13. Wie verhindere ich, dass Googlebot Links auf meinen Seiten verfolgt?

    Damit Googlebot keinen Links auf Ihren Seiten folgt, die zu anderen Seiten oder Dokumenten führen, platzieren Sie das folgende Meta-Tag in die Kopfzeile Ihres HTML-Dokuments:
    <META NAME="Googlebot" CONTENT="nofollow">

    METAFAKTEN // Netzgeschehen und freie Software

  • hallo!

    gibt es sowas wie eine 'optimale' robots.txt?

    ich möchte alle gängigen suchmaschinen aussperren. natürlich auch gerne 'böse' crawler/spider. die sind für mich aber nicht in erster linie wichtig, scheint wohl auch nicht allzu einfach zu sein. mir geht es vor allem darum, die großen, populären suchmaschinen auszusperren (google, yahoo, msn und konsorten).

    bloglistings können eigentlich gerne drinbleiben. soweit ich das ganz ganze thema verstanden habe, müsste ich dafür ja alle trackbacks/pingbakcs und den update service deaktivieren, die ich aber eigentlich beibehalten möchte für verlinkungen mit anderen blogs.
    kann man das ganze nicht auch über ein plugin lösen, bspw. eins, das die robots.txt verwaltet und aktuell hält???

  • Also meiner Meinung nach wirst du die grossen Suchmaschinen nicht aussperren können.
    Jeder Link zu deiner Seite, egal wo er auftaucht, ob hier im Forum oder in den Bloglisten, führt Suchmaschinen zu deiner Seite, sofern diese Seiten von Suchmaschinen gecrawlt werden.

    Du kannst es natürlich über die robots.txt versuchen:

    Code
    # No robot will spider the domain
    User-agent: *
    Disallow: /


    Und dann natürlich noch in deiner index.php im header bereich

    Code
    <meta name="robots" content="noindex,nofollow">


    So das ist alles was mir dazu einfällt :) Viel Glück !

    Grüße Blackstar

  • hält mir das auch google, yahoo, msn etc. vom hals?
    nach allem, was ich bisher gelesen habe, dachte ich das wär alles viel schwieriger...
    :confused:

  • Das kann ich dir nicht beantworten!
    Generiere einfach mal eine robots.txt wie oben beschrieben und schau deine Statistiken an ob Google und Konsorten noch vorbeischauen ....

    Warum willst du die eigentlich fernhalten? Das habe ich noch nicht ganz kapiert.

Jetzt mitmachen!

Sie haben noch kein Benutzerkonto auf unserer Seite? Registrieren Sie sich kostenlos und nehmen Sie an unserer Community teil!