Googlebot erstellt selbst Suchanfragen

  • ...
    Für mich klingt dabei dann die Google Toolbar Idee am schlüssigsten irgendwie (obwohl es schon komisch ist, dass deine Wortschöpfungen gesucht werden). Man müsste dazu mal mit diesem Plugin gegenchecken, welche Wörter die User in das Suchform eintragen und suchen und welche Wörter der Googlebot einträgt. Vielleicht gibt's da ja ne Kongruenz. :)


    Für mich klingt die Google-Toolbar-Theorie überhaupt nicht schlüssig :-)
    Meine Auswertung der Logfiles hat ergeben, das wie oben bereits erwähnt, Google bisher 2155 mal meine Blogsuche mit 770 unterschiedlichen Wörtern befragt hat. Normale Nutzer haben bisher 136 mal nach 103 verschiedene Wörtern (und Wortkombinationen, das macht Google nicht) gesucht. Es gibt aber nur ganze 9 (in Worten: neun) Überschneidungen.

    Gruß
    Ingo

    Wenn ich helfen konnte, bitte [ Gefällt mir ] klicken. :-)

    • Anzeige

    Hallo!

    Wenn du gerade an deiner Website arbeitest oder dein aktuelles Hosting überdenkst: Wir betreiben mit NetzLiving eine Hosting-Plattform, die speziell auf Performance, Sicherheit und einfache Verwaltung ausgelegt ist.

    • ✔️ Schnelle Ladezeiten (optimiert für WordPress & Co.)
    • ✔️ Deutsche Server & DSGVO-konform
    • ✔️ Persönlicher Support (kein 0815-Ticket-System)

    Mehr erfahren

  • Ich probiere das jetzt auch mal mit dem SearchMeter Plugin zum Abgleichen. :)

    Hier gibt's übrigens ähnliche Meinungen wie hier: Googlebot going through internal search forms

    Auch interessant: Google indexing large volumes of (unlinked?) dynamic pages
    (Ich weiß, viel zu lesen :))..

    Was mich wundert ist, dass überall gesagt wird, dass Google nie ein Formular abschicken wird (es sei denn, du willst es für geschützte Seiten). Offenbar hat sich dies aber geändert, wenn ich mir dieses Patent anschaue: United States Patent Application: 0060230033
    Ich kann mir aber dennoch nicht vorstellen, dass der Bot zufällige Abfragen ausführt, sondern dass die irgendwo herkommen und Google sie nur ausführt, und so vielleicht "menschlicher" agieren soll (indem er "human queries" crawlt). Das würde IMO wieder für die Toolbar/Analytics Theorie sprechen.. leider bisher nur eine Theorie.

    wpseek.com - Die WordPress-Code-Suchmaschine

    Einmal editiert, zuletzt von Alphawolf (31. Januar 2008 um 12:43)

  • Naja, zumindest zeigen mir die Links, das ich nicht der einzige bin, der das beobachtet hat und sich darüber Gedanken macht.

    Wobei ich die Toolbar/Analytics-Theorie wohl irgendwie noch nicht ganz verstanden habe. Ich verwende weder das eine, noch das andere.

    Gruß
    Ingo

    Wenn ich helfen konnte, bitte [ Gefällt mir ] klicken. :-)

  • Das (aus dem zweiten Link) scheint mir auch plausibel:

    Zitat

    - Googlebot is spidering GET forms by getting the form variables and either leaving them blank or assigning values to them (sometimes taken from options in the form itself)
    - Google has a list of words present on the site
    - This list of words is being used to populate the form variables, and the URL requested via GET

    ...

    It would be an odd thing to do, but would allow Google to access data that would previously be hidden to spidering, I suppose. (Hervorhebung von mir)

  • Das ist ja im Prinzip genau das, was ich behaupte "Googlebot erstellt selbst Suchanfragen" :-)

    Er nimmt halt nicht nur Links, die er irgendwann mal irgendwo "gesehen" hat, sondern baut mit den GET-Variablen und der Wortliste selbständig Anfragen zusammen. Das Google niemals nicht selbständig Formulare ausfüllt, kann man also so nicht mehr sagen.

    Gruß
    Ingo

    Wenn ich helfen konnte, bitte [ Gefällt mir ] klicken. :-)

  • dies kommt bei mir auch vermehrt vor.

    ich würde mir das so erklären:

    google möchte ihre suchergebnisse verbessern, und vielleicht irgendwie eine art semantische suche aufbauen.

    wenn der G-bot auf ein wort stößt, welches auf dem weblog ungewöhnlich oft vorkommt, oder gar gänzlich neu ist, dann versucht der bot herauszufinden, was mit diesem wort zu tun haben könnte. also versucht er ein möglichst eng verwandtes vokabular zu identifizieren. und wo sucht man besser, als an der quelle selbst?

    google könnte zwar auch den eigenen index durchsuchen, allerdings schätzt man bei google die treffgenauigkeit wohl als besser ein, wenn man die seiteneigene suche nutzt. Diese ist nämlich aktueller, und liefert wohl auch mehr ergebnisse, als im google index zu finden sind.

  • [FONT=Arial]Referrer-Spam von Google und Microsoft - SISTRIX Suchmaschinen Blog[/FONT]

    google will so cloaking ausfindig machen, könnt logisch sein, aber bis dato machte dies meist nur msn ;)

    lg

  • Vielleicht macht Google das, aber zumindest bei mir scheint das nicht der Fall zu sein, zumindest sagen das meine Logs. Ich werd Google mal anschreiben, vielleicht sagen die es mir ja. ;)

    "Ja, auf Ihrer Seite testen wir das seit geraumer Zeit, da wir so Ihren AdSense CTP-Wert in die Höhe treiben sollen.." :oops: :mrgreen:

    wpseek.com - Die WordPress-Code-Suchmaschine

    Einmal editiert, zuletzt von Alphawolf (11. Februar 2008 um 15:27)

  • sperre dies per robots.txt aus, zumindest die Indexierung

    das sind de facto keine Suchanfragen des google bots, sondern er sucht nach diesen Seiten weil die mal im Index gelandet sind und er sie wieder abgrasen mag...


    Disallow: /?s*

    lg

    Gute Idee. Gleich bei mir eingestellt

  • Ja, das klingt plausibel. Das Suchfeld wird zwar nun nicht bei jeder kleinen Seite auftauchen, aber technisch gesehen macht Google-Bot da wohl erstmal keinen Unterschied. Ist letztendlich auch egal, zumindest kann nicht mehr behauptet werden, Goolge würde niemals nicht selbständig Formulare ausfüllen. Was anderes ist ja so ein Suchlink auch nicht.

    Gruß
    Ingo

    Wenn ich helfen konnte, bitte [ Gefällt mir ] klicken. :-)

  • der grund dafür kann sein, dass ihr eine sitemap.xml / siteinfo.xml bereitstellt, in der die such-url an google übermittelt wird ;-)

    Code
    <item>
            <text>Titel</text>
            <textSearch>Search: [[:SEARCHTERMS:]]</textSearch>
            <urlSearch>http://www.example.org/?s=[[:SEARCHTERMS:]]</urlSearch>
            <tooltip>Search</tooltip>
          </item>


    diese nutzt google dann auch.

  • Ach Du warst das, der bei mir versucht hat, eine sitemap.xml aufzurufen :-)
    Gibts bei mir aber nicht, auch keine siteinfo.xml.

    Gruß
    Ingo

    Wenn ich helfen konnte, bitte [ Gefällt mir ] klicken. :-)

  • Google Toolbar und FireFox Plugins wie LivePR oder AlexaRank

    Für alle zur Information: Diese Browsererweiterungen fragen bei jedem Seitenabruf des Browser bei eingeschalteter PR/AlexaRank Anzeige den PR/AlexaRank der aktuell angesuften Seite an.
    Wenn also Google oder Alexa eine Rank Anfrage per Toolbar oder Plugin bekommen (was auch nichts anderes als eine HTML get/post Anfrage ist) und sie die Seite nicht kennen aber deine anderen Seiten bereits halbwegs gerankt sind, dann schicken sie umgehend den Bot vorbei.
    Wenn also ein Besucher deiner Seite mit einer Toolbar/Plugin surft und bei dir die Suche im Blog verwendet, dann führt das u.U. zum Spidern der Suchanfragen, da die besagten Urls "/?s=xxxx" so durch die Toolbar/Plugins für die Rankanfrage durchgereicht werden noch ehe deine Domain die Anfrage bekommt.
    Auf diese Weise spidern die auch den Admin Login, wenn man diese Toolbars/Plugins an hat, während man sich einloggt.
    Abhilfe schafft da nur das Aussperren per .htaccess Datei.

  • Sehr lustig finde ich die Aussage beim offiziellen Statement:

    Zitat

    Specifically, when we encounter a <FORM> element on a high-quality site, we might choose to do a small number of queries using the form.

    "high-quality site" und "small number of queries", ist natürlich immer eine Frage, was das bedeutet. Zumindest hat der Googlebot bei mir bisher 770 verschiedene Stichwörter insgesamt 4800 mal abgefragt.
    Viele Wörter hat er nur ein- oder zwei zweimal gecrawlt, es gibt aber auch ein paar Lieblingswörter, die er immer wieder abfragt z.B.:
    putzlowitsch, gerech, zune, jappy, zutreten und fäll.

    Und nein, die 770 Wörter haben bestimmt keine User dadurch an Google übermittelt, das sie diese bei mir gesucht haben und dabei die Google-Toolbar oder ein Pagerank-Tool am Start hatten.

    Ist auch egal, von mir aus soll Google das meinetwegen machen. Wenn es Besucher auf meine Seiten bringt, bitte schön :-)

    Gruß
    Ingo

    Wenn ich helfen konnte, bitte [ Gefällt mir ] klicken. :-)

  • ..
    Ist auch egal, von mir aus soll Google das meinetwegen machen. Wenn es Besucher auf meine Seiten bringt, bitte schön :-)
    ...

    nee:(

    Google schickt dann Deine Seite wegen zuviel internen doppelten COntent ins Nirvana

    :evil: ..verursachen es selber und *bestrafen* dann

    sperr ihn per robots.txt für sowas aus

    ist besser ....

    lg

  • Och doch, mir ist das echt recht :-)
    Ich habe schon so genug doppelten Content drin, da kommt es dann darauf auch nicht mehr an.

    • Der Kalender enthält Links auf jeweils einen Tag meines Blogs. Da ich meist nur einen Artikel pro Tag schreibe, sind diese Tagesarchive weitestgehend identisch mit dem jeweiligen Einzelartikel => DC
    • Das Monatsarchiv enthält auch alle Artikel nochmal => DC
    • Die Kategorie-Links enthalten ebenso alle Artikel, zwar in anderer Zusammenstellung, aber dennoch mit selben Inhalten => DC
    • Auch die Tags ergeben wieder, wie bei Kategorien, anders zusammengestellte, aber dennoch gleiche Inhalte => DC

    Wenn man so will, sind diese von Google generierte /?s=xyz Abfragen dynamisch erstellte Tags. Genau den selben Effekt hätte ich, wenn ich eben dieses xyz als Tage bei den Beiträgen vergebe, in denen es auch vorkommt.

    Vielleicht noch als kleiner Nachtrag. Ich gebe bei mir auf allen Archiv-, Kategorie- oder Tagseiten immer die kompletten Inhalte so wie auf der Startseite aus, gegebenfalls nur beim <!--more--> abgetrennt.

    Gruß
    Ingo

    Wenn ich helfen konnte, bitte [ Gefällt mir ] klicken. :-)

Jetzt mitmachen!

Sie haben noch kein Benutzerkonto auf unserer Seite? Registrieren Sie sich kostenlos und nehmen Sie an unserer Community teil!