Google / duplicate content ... warum sind Wordpress-Suchergebnisseiten im Index?

  • Hallo miteinander!

    Mir ist bei meinem Blog aufgefallen, dass Google wesentlich mehr Seiten indiziert hat, als eigentlich vorhanden sind.

    Mit einer kurzen Abfrage war dann schnell klar, dass Google - aus welchem Grund auch immer - beliebige Wordpress-interne Suchabfragen in seinen Index aufnimmt. Es stehen also haufenweise Seiten nach dem Schema "domain.de/index.php?s" drin. (ca. 600 gegenüber ca. 300 realen Seiten)

    Siehe: "http://www.google.de/search?q=site:…ll&start=0&sa=N"

    Diese "Seiten" sind wohl eher nicht so gut hinsichtlich duplicate content (... ja ich weiß, manche streiten um dessen Relevanz).

    Ich denke mal, dass die auch wieder verschwinden werden, nachdem ich in die robots.txt ein "Disallow:/index.php?s=*" reingeschrieben habe.


    ABER: woher kommen denn diese automatischen Wordpress-Suche-Ergebnisseiten im Google-Index? Auf ca. 10-15 Suchergebnisse habe ich Links gesetzt ... der Rest ist mir echt ein Rätsel.

    Bisher hab ich weder im Forum noch über Google was dazu gefunden. Ein Link oder eine kurze Erklärung würde mir also schon weiterhelfen.

    Vielen Dank und Grüsse,
    Stephan

    P.S.: kann vermutlich erst wieder abends reinschauen ...


    Einmal editiert, zuletzt von Stephan33 (4. Januar 2008 um 13:35)

    • Anzeige

    Hallo!

    Wenn du gerade an deiner Website arbeitest oder dein aktuelles Hosting überdenkst: Wir betreiben mit NetzLiving eine Hosting-Plattform, die speziell auf Performance, Sicherheit und einfache Verwaltung ausgelegt ist.

    • ✔️ Schnelle Ladezeiten (optimiert für WordPress & Co.)
    • ✔️ Deutsche Server & DSGVO-konform
    • ✔️ Persönlicher Support (kein 0815-Ticket-System)

    Mehr erfahren

  • Einfachste Lösung: in die header.php deines Themes folgendes schreiben:

    PHP
    <?php if( is_search() ) {
      echo '<meta name="robots" content="noindex, follow" />';
    } ?>

    Bei deiner robots.txt-Lösung solltest du den '*' am Ende weglassen - Wildcards sind im robots.txt-Standard nicht erlaubt und hier auch nicht nötig. Alle URLs die mit /index.php?s= beginnen, werden ausgeschlossen.

    Irgendwer muss aber die Links auf deine Suchergebnisseiten setzen, Google führt selbstständig keine Formularanfragen aus (d.h. auch keine Suche). Dafür kann Google ein seeehr langes Gedächtnis haben, besonders dann wenn man die betreffenden URLs aus dem Index haben will. ;-) Zur Not existiert ein URL-Removal-Tool (mal in den Google-Tools suchen).

  • Hallo marX,

    dank dir für die schnelle Info, ich hab soeben die robots.txt angepasst. Ich überleg mir noch, ob ichs alternativ über die header.php machen soll. Hätte das denn Vorteile?

    Zitat

    Irgendwer muss aber die Links auf deine Suchergebnisseiten setzen, Google führt selbstständig keine Formularanfragen aus (d.h. auch keine Suche)

    --> genau das ist der Knackpunkt!! Ich selbst hab die Links nicht (absichtlich) gesetzt, aber woher kommen die denn sonst, wenn nicht irgendwo automatisch aus Wordpress??? Ich kann mir nicht vorstellen, dass sich jemand anders damit Arbeit macht.

    Kennt sonst noch jemand dieses Problem, wenns denn eines ist, wie ich halt momentan vermute??

    Viele Grüsse,
    Stephan


  • dank dir für die schnelle Info, ich hab soeben die robots.txt angepasst. Ich überleg mir noch, ob ichs alternativ über die header.php machen soll. Hätte das denn Vorteile?


    Hat beides Vor- und Nachteile. Die robots.txt sollte aber ausreichen, sofern die Syntax dort korrekt ist.


    Zitat

    --> genau das ist der Knackpunkt!! Ich selbst hab die Links nicht (absichtlich) gesetzt, aber woher kommen die denn sonst, wenn nicht irgendwo automatisch aus Wordpress??? Ich kann mir nicht vorstellen, dass sich jemand anders damit Arbeit macht.

    Kennt sonst noch jemand dieses Problem, wenns denn eines ist, wie ich halt momentan vermute??


    Keine Ahnung. WP dürfte aber nicht dafür verantwortlich sein. Ich wüsste jetzt keine Stelle, wo die Such-URLs in einer Standardinstallation auftauchen. Eventuell werden die durch ein Suche-Plugin hervorgerufen.
    Eins meiner Blogs ist z.Z. mit 309 Unterseiten in Google vertreten, was auch in etwa der Anzahl der geschriebenen Beiträge entspricht.

  • böse bots, mancher macht sich die Arbeit, mancher läßt ein SUchergebnis gut ne halbe Stunde stehen =im Index drin


    usw...

    lg

  • Die meisten der Suchabfragen sollten aber kein DC sein es esei denn du hättest nur sehr wenige Artikel. Insofern auch keien gefahr für Abwertungen bei Google (vor allem nicht falls du ohnehin in der Suche nur die Kurzfassungen anzeigst).

    ich würde es drin lassen: mehr Seiten im Index sind nie verkehrt ...

  • .....

    ich würde es drin lassen: mehr Seiten im Index sind nie verkehrt ...

    spätestens seit März 2007 sehr wohl...


    :-? interner DC ist oft tödlich

    lieber weniger aber die ganz ganz vorne :mrgreen:

  • Warum ist es denn tödlich?

    Selbst wenn Google die Seiten als DC einstufen würde (was bei Suchabfragen aus 10 verschiedenen Arikeln recht selten vorkommt) gäbe es halt nur eine Version dieser Seiten im Index und nicht alle Seiten. Mehr passiert nicht - tödlich würde ich das nicht nennen ...

Jetzt mitmachen!

Sie haben noch kein Benutzerkonto auf unserer Seite? Registrieren Sie sich kostenlos und nehmen Sie an unserer Community teil!