Přejít k obsahu
GetProfit

← Všechny pojmy

Googlebot

Googlebot je obecný název crawlerů Vyhledávání Google, tedy programů, které stahují stránky webu, aby je Google mohl zvážit pro svůj index.

Jak to funguje

Googlebot má dva typy, Smartphone a Desktop. Většina požadavků pochází od crawleru pro chytré telefony, protože u většiny webů Google indexuje hlavně mobilní verzi. Nové adresy Googlebot nachází většinou z odkazů na stránkách, které už prošel.

Obchod navštěvují i další crawlery Googlu. Storebot-Google prochází stránky produktů, košíku a pokladny, aby pro Google Shopping získal údaje o ceně, dopravě a platbě. AdsBot kontroluje cílové stránky reklam. Google-InspectionTool stahuje stránky pro nástroj „URL Inspection“ v Google Search Console.

User agent, tedy název crawleru v každém požadavku, je snadné zfalšovat, proto Google sám ověřuje IP adresu. Reverzní vyhledání DNS musí vrátit název v doméně googlebot.com, google.com nebo googleusercontent.com. Přímé vyhledání tohoto názvu musí vrátit stejnou IP adresu. Funguje i publikovaný seznam IP adres Googlu.

Pokud ochrana proti botům odpoví skutečnému crawleru stavem 403, Google stránku považuje za neexistující a odstraní ji z indexu. Stav 429 nebo 5xx procházení zpomalí; zaindexované stránky na čas zůstanou, ale nakonec vypadnou. Náš průvodce ukazuje, jak ověřit Googlebot za ochranou proti botům na CDN.

Příklad

Ukázkový obchod, nejde o data klientů.

Log CDN obchodu se stolním nádobím ukazuje dva požadavky s user agentem Googlebotu. U 66.249.66.1 dá reverzní vyhledání crawl-66-249-66-1.googlebot.com, což se přeloží zpět na stejnou IP adresu: je to Googlebot. Druhá IP adresa se přeloží na doménu hostingové firmy: je to napodobitel, kterého lze bezpečně zablokovat.

Nezaměňovat s

  • Indexace — Googlebot stránky stahuje a indexace rozhoduje, zda je Google ponechá. Zablokování crawleru v robots.txt neudrží URL mimo výsledky.

Správný a chybný výklad

  • Špatně: „Poslali jsme požadavek s user agentem Googlebotu, dostali jsme 403, takže CDN blokuje Google.“ Správně: požadavek z vaší vlastní IP adresy ukazuje, jak ochrana zachází s napodobitelem, ne s Googlebotem.
  • Špatně: „robots.txt Googlebot povoluje, takže crawler Google Shopping projde.“ Správně: Storebot-Google má v robots.txt vlastní název user agenta a pravidla napsaná pro Googlebot se na něj nevztahují.

Zdroje