Jak funguje Googlebot: objevování a procházení webu

Než se stránka objeví ve výsledcích vyhledávání, musí ji Google nejdřív objevit, poté projít (crawl) a nakonec zaindexovat. Za první dva kroky odpovídá Googlebot – automatický robot, který nepřetržitě prochází web a stahuje obsah. Když rozumíte tomu, jak Googlebot objevuje a prochází web, dokážete mu práci usnadnit a novou URL dostat do indexu výrazně rychleji.
Co je Googlebot a jak objevuje nové stránky
Googlebot je crawler – program, který si stahuje stránky stejně jako prohlížeč, ale místo zobrazení z nich vytáhne text, odkazy a metadata. Nové URL nachází primárně třemi cestami: přes odkazy z už známých stránek, přes XML sitemapu a přes URL odeslané k procházení (např. přes Indexing API). Nejsilnějším signálem jsou odkazy – když na novou stránku nic neodkazuje, Google o ní často dlouho neví. Podrobněji to rozebírá článek Signály objevení URL.
Fronta procházení a crawl budget
Objevená URL se nezpracuje hned – zařadí se do fronty a čeká, až na ni Googlebot dostane čas. Kolik stránek z webu robot projde za den, ovlivňuje takzvaný crawl budget: u malých webů není limitem prakticky nikdy, u velkých ale rozhoduje o tom, jestli se robot dostane i k méně důležitým stránkám. Jak crawl budget funguje a čím se plýtvá, vysvětluje Crawl budget.
Co Googlebotovi pomáhá stránku najít
Objevování urychlíte tím, že na novou stránku co nejdřív povede cesta. Přidejte na ni interní odkaz z už zaindexované a často procházené stránky (třeba z homepage nebo rozcestníku rubriky), zařaďte URL do sitemapy a ideálně ji rovnou odešlete Googlu. Sílu interního prolinkování popisuje Interní prolinkování; proč sitemapa sama o sobě nestačí, řeší Jak odeslat sitemapu.
Co objevování zpomaluje nebo blokuje
Googlebot se k obsahu nedostane, když ho k tomu web nepustí. Nejčastější brzdy jsou blokace v robots.txt, značka noindex, pomalý nebo nedostupný server (5xx) a osamocené stránky bez jediného odkazu. Rozdíl mezi blokací procházení a zákazem indexace vysvětluje Robots.txt a noindex – snadno se totiž zamění a výsledek je pokaždé jiný.
Objeveno ještě neznamená zaindexováno
To, že Googlebot stránku objevil a prošel, není záruka zařazení do indexu. Google obsah ještě posoudí a slabé, duplicitní nebo tenké stránky nechá ve stavu „objeveno – momentálně neindexováno". Jestli Google vaši stránku skutečně vidí a jak si to ověřit, ukazuje Jak poznat, že Google stránku vidí.
Jak procházení urychlit
Objevování je z velké části ve vašich rukou: čistá struktura URL, silné interní prolinkování, aktuální sitemapa a rychlý server dají Googlebotovi jasné signály, kam se vydat. Když potřebujete novou URL do indexu co nejdřív, nečekejte na náhodné procházení a odešlete ji aktivně – jak na to, shrnuje Jak zaindexovat novou URL.
Potřebujete dostat URL rychleji do Googlu?
Na urlindex.cz hromadně odešlete URL Googlu k procházení a navíc ohlídáte, které se opravdu zaindexovaly. Nahrajete sitemapu nebo seznam URL a o zbytek se postaráme.