Seit einigen Monaten meldet mir Google eine immer weiter steigende Anzahl der "gecrawlten, aber zurzeit nicht indexierten Seiten". Das ist aber nicht das eigentliche Problem - sondern ich würde gerne wissen, woher Google diese urls hat. Auf meiner Seite existieren diese urls nämlich nicht. Zumindest nicht absichtlich.
Diese fraglichen urls haben fast alle ein Muster, welches sich aus einer tatsächlichen vorhandenen Seite und verschiedenen Anhängseln zusammensetzt, also z.B.:
example.com/existierende Seite/?replytocom=35843
example.com/existierende Seite/?hilite='such-string1'+'/'///////////
example.com/existierende Seite/?hilite=such-string2//////////////////
Anm: Die mehrfachen Schrägstriche sind auch Bestandteil der beanstandeten Seiten.
Alle diese urls sind nicht wirklich existent. Und es gibt auf meiner Seite auch keine Links, die so aussehen. Ich frage mich daher: Wie kommt Google dazu, diese urls zu crawlen?
Danke für evtl. Tipps.