Woher stammen diese mysteriösen urls?

  • Seit einigen Monaten meldet mir Google eine immer weiter steigende Anzahl der "gecrawlten, aber zurzeit nicht indexierten Seiten". Das ist aber nicht das eigentliche Problem - sondern ich würde gerne wissen, woher Google diese urls hat. Auf meiner Seite existieren diese urls nämlich nicht. Zumindest nicht absichtlich.
    Diese fraglichen urls haben fast alle ein Muster, welches sich aus einer tatsächlichen vorhandenen Seite und verschiedenen Anhängseln zusammensetzt, also z.B.:
    example.com/existierende Seite/?replytocom=35843
    example.com/existierende Seite/?hilite='such-string1'+'/'///////////
    example.com/existierende Seite/?hilite=such-string2//////////////////
    Anm: Die mehrfachen Schrägstriche sind auch Bestandteil der beanstandeten Seiten.

    Alle diese urls sind nicht wirklich existent. Und es gibt auf meiner Seite auch keine Links, die so aussehen. Ich frage mich daher: Wie kommt Google dazu, diese urls zu crawlen?
    Danke für evtl. Tipps.

    • Anzeige

    Hallo!

    Wenn du gerade an deiner Website arbeitest oder dein aktuelles Hosting überdenkst: Wir betreiben mit NetzLiving eine Hosting-Plattform, die speziell auf Performance, Sicherheit und einfache Verwaltung ausgelegt ist.

    • ✔️ Schnelle Ladezeiten (optimiert für WordPress & Co.)
    • ✔️ Deutsche Server & DSGVO-konform
    • ✔️ Persönlicher Support (kein 0815-Ticket-System)

    Mehr erfahren

  • Das erste Beispiel wird von WordPress auf Kommentarseiten erzeugt (mehr dazu), die anderen beiden Beispiele sind automatisierte Bots die ohne Sinn und Verstand alle mögliche SQL Injection o.ä. Schwachstellen durchprobieren, ob die bei Dir passen oder nicht...


    Ja, danke. Die Ideen sind gut, passen aber meiner Meinung nach nicht.
    Bei meinen Kommentaren gibt es zwar einen Antwort-Link, der enthält aber keinen replytocom Teil, sondern sieht so aus:
    example.com/existierende Seite/#comment-35843
    Und an die Bots habe ich auch schon gedacht, aber wenn da einer willkürlich Links probiert, dann bekommt er entweder eine Fehlermeldung (weil die Seite nicht existiert) oder bekommt die existierende Seite geliefert, weil die url-Anhängsel gar nicht verarbeitet werden. Beides wäre aber doch keine Erklärung, warum Google diese urls crawlt. Es sei denn Google selber würde ohne Sinn und Verstand willkürliche Kombinationen durchprobieren. Das halte ich für unwahrscheinlich. Oder?

  • Link zu Deiner exakten Beispielseite mit Antwortkommentaren? Viele Bots tun so als wären sie Google.


    Einen Link zu der betroffenen Seite möchte ich hier nicht veröffentlichen. Ich kann aber gerne alles prüfen und nachsehen, was zu einer Lösung führt.
    Die Aussage, dass "viele Bots so tun als wären sie Google", habe ich nicht verstanden. Mir ist zwar bewusst, dass sich einige Bots als Google-Bots tarnen - aber sie werden ja wohl kaum ihre Ergebnisse anschliessend an Google weitermelden. Aber die Meldungen über die "gecrawlten, aber zurzeit nicht indexierten Seiten" stammen ja von Google selber, genauer von der Google Search Console. Ich sehe da keine Verbindung zwischen der Google Search Console und Bots, die sich als Google-Botgs tarnen.

  • Ohne weitere Details wird Dir kaum jemand sinnvoll weiterhelfen können, ob/wo diese Links anderswo extern oder innerhalb Deiner Seite auftreten.

    Du kannst ggf. in der Search Console beim jeweiligen Link die URL Prüfen und in der jeweils zugehörigen Seitenindexierung bei Verweisende Seite weitere Hinweise bekommen. Wende Dich ggf. hierfür auch an ein Google Search Console Forum.

  • Danke für die bisherigen Ideen. Leider haben sie mich noch nicht weiter gebracht.
    Mein eigener Ansatz war bisher, einmal nach einem Zusammenhang mit dem oft vorkommenden url-Anhängsel ?hilite='such-string1' zu suchen. Die Ergänzung ?hilite stammt von einem Plugin, welches im Anschluss an eine Suchfunktion den gesuchten String farblich markiert.
    Somit wäre die Suchergebnisseite tatsächlich eine Seite, die mehrere Links in der Form example.com/existierende Seite/?hilite='such-string1' enthält.
    Aber nach meinem Verständnis ist die Suchergebnisseite doch eher eine temporäre Ansicht für einen User und kann daher von Google gar nicht gecrawlt werden, oder? Oder gibt es irgendwo eine Suchergebnisseite, die ich evtl. auch konfigurieren könnte und z.B. das Crawlen verbieten?

  • Ich frage mich woher du diese URLs überhaupt hast, wo du sie siehst. Du sagst Google meldet sie dir. Mit welchem Tool von Google? Wenn es die Search Console ist so kannst du dort zu jeder URL auch Details aufrufen und sehen woher diese referenziert werden.

    Wenn es die Search Console ist, dann sind das URLs die der Google Bot zu deiner Seite gefunden hat. Diese URLs sollten dabei primär auf deiner Seite verlinkt sein, nicht auf anderen. Wenn andere Websites aber diese URLs verwenden um auf deine Website zu verlinken, dann kann Google diese dort finden, in den Index aufnehmen und dir auch in der Search Console anzeigen. Das müsstest du an den o.g. Details erkennen können.

    Die Parameter der von dir genannten Beispiele sind übrigens kein WordPress-Standard. Der WordPress Core kennt weder "replytocom" noch "hilite". Wenn so etwas auf deiner Website verlinkt wird, dann stammt das von von dir genutzten Plugins. Wenn sie irgendwo extern verlinkt werden, dann sind es historische URLs (von früheren Websites die unter deiner Domain liefen) oder merkwürdige Versuche den Google Bot auf bei dir nicht existierende URLs aufmerksam zu machen, die vlt. bei irgendeiner Website-Software (nicht unbedingt WordPress) zu Fehlern führen.

    Ich würde dir daher empfehlen:

    * Nochmal die Details in der Google Search Console genau anzuschauen.
    * Selbst nach diesen URLs per Google zu suchen, z.B. mit "link:example.com"
    * In deiner Website z.B. mit dem Plugin "Redirection" derartige Aufrufe zu erfassen und ggfs. in deinem Sinne weiterleiten zu lassen - es sollte ein HTTP-Status 301 sein damit Google erkennt "ah, gibts nicht (mehr)"

  • Der WordPress Core kennt weder "replytocom"


    Doch, siehe https://core.trac.wordpress.org/browser/tags/6…plate.php#L1846

    noch "hilite"


    Der [FONT=Courier New]hilite[/FONT] Parameter könnte aus einem Plugin stammen, leider gibt es keinen Link zur Seite und somit keine Möglichkeit, zu prüfen, ob/welche Plugins verwendet werden.

    Und die in Antwort #6 beschriebenen ggf. Details bei Verweisende Seite in der Google Search Console Seitenindexierung werden offenbar nicht gefunden.

    Somit ist das hier alles ein großes Ratespiel.

  • Danke für die weiteren Ideen/Hinweise. Ich will gerne noch einmal präzisieren, was ich bisher feststellen konnte:
    * Die Meldungen über die "gecrawlten, aber zurzeit nicht indexierten Seiten" stammen alle von der Google Search Console.
    * Es sind immer urls, die NUR meine Domain betreffen, häufig nach dem Muster:
    meine-domain/existierende Seite/?replytocom=35843
    meine-domain/existierende Seite/?hilite='such-string1'
    manchmal auch beides kombiniert, also: meine-domain/existierende Seite/?hilite='such-string1'/?replytocom=35843
    manchmal auch mit einer merkwürdigen Syntax (mehrere Schrägstriche u.ä.)
    * Es sind inzwischen sehr viele dieser Meldungen: Bei ca. 400 korrekt indexierten Seiten sind es knapp 40.000 Seiten mit dem beschriebenen Problem.
    * Eine stichprobenartige Detail-Prüfung einzelner Meldungen, ergibt überall, dass die verweisende Seite(n) ebenfalls von meiner Domain stammen und auch dasselbe Muster aufweisen, also z.B. meine-domain/existierende Seite/?hilite='such-string1'. Oftmals ist die untersuchte url identisch mit der verweisenden Seite. Manchmal gibt es auch mehrere verweisende Seiten, dann aber alle von meiner Domain und alle mit einem der fraglichen Muster.
    * Für den ?replytocom Parameter habe ich komplett keine Erklärung.
    * Der ?hilite Parameter stammt von einem Plugin, welches auf der Suchergebnisseite (als Ergebnis einer User-Suchfunktion) den gesuchten String farblich markiert. Somit wäre die Suchergebnisseite tatsächlich eine Seite, die mehrere Links in der Form meine-domain/existierende Seite/?hilite='such-string1' enthält. Aber nach meinem Verständnis ist die Suchergebnisseite doch eher eine temporäre Ansicht für einen User und kann daher von Google gar nicht gecrawlt werden, oder? Für die Suchergebnisseite existiert nach meinem Verständnis höchstens ein Template, welches dann jeweils für die entsprechende Anfrage gefüllt wird.
    * Das Plugin heisst "Highlights Search Terms".
    * Denn Vorschlag mit der Redirection habe ich nicht verstanden. Zum einen ist mir nicht klar, wie ich "derartige" Aufrufe erfassen soll, andererseits würde ich dann damit vermutlich die tatsächlich existierende Seite umleiten (was ich natürlich will) und letztlich: wenn es die Maßnahme Erfolg hätte, würde sich anschliessend in der Google Search Console vermutlich nur die Meldung ändern, anstatt "gecrawlt - zur Zeit nicht indexiert" dann eben "Seite mit Weiterleitung". Damit wäre nicht viel gewonnen.

    Wenn es weitere Ideen gibt: Sehr gerne!

Jetzt mitmachen!

Sie haben noch kein Benutzerkonto auf unserer Seite? Registrieren Sie sich kostenlos und nehmen Sie an unserer Community teil!