Crawl budget a velké e-shopy: jak ho neplýtvat na filtry a duplicity
Googlebot nemá na váš e-shop neomezený čas. Když ho utrácí za kombinace filtrů a řazení, nové produkty čekají na indexaci zbytečně dlouho. Ukážeme, jak zjistit, kam robot chodí, a jak ho nasměrovat.
E-shop přidá sto nových produktů. Za týden jsou v Googlu tři. Majitel se ptá, jestli je chyba v textech. Často není. Googlebot mezitím prošel desítky tisíc kombinací filtrů, řazení a stránkování a na nové produkty se nedostal.
Tomu se říká plýtvání crawl budgetem. Týká se hlavně velkých katalogů. Ale protože filtry umí z pár tisíc produktů udělat statisíce URL, potkáváme ho i u středně velkých e-shopů. V článku ukážeme, jak poznat, jestli se vás to týká, jak to změřit a co s tím dělat.
Co je crawl budget a koho se týká
Crawl budget je čas a zdroje, které Google věnuje procházení vašeho webu. Podle dokumentace Googlu ho určují dvě věci. Crawl capacity limit je, kolik souběžných spojení a jak rychle si Googlebot dovolí, aby server nepřetížil. Crawl demand je, jak moc o vaše URL stojí, podle jejich popularity, kvality a toho, jak rychle zastarávají. Podrobněji to vysvětlujeme v hesle crawl budget.
Google sám říká, že pokud web nemá velké množství rychle se měnících stránek nebo pokud nové stránky prochází ještě v den zveřejnění, jeho průvodce ke crawl budgetu číst nemusíte. Pro e-shop je to dobrý první test:
- Zveřejněte nový produkt a sledujte v Search Console přes kontrolu URL, kdy ho Google poprvé procházel.
- Pokud to trvá dny až týdny a v přehledu indexace roste počet stránek ve stavu „Objeveno – momentálně neindexováno", je čas se crawl budgetem zabývat.
Stav „Objeveno – momentálně neindexováno" znamená, že Google o URL ví, ale ještě ji nestáhl. To bývá signál, že procházení nestíhá. Stav „Procházeno – momentálně neindexováno" je jiný problém: Google stránku viděl a do indexu ji nezařadil, typicky kvůli slabému nebo duplicitnímu obsahu.
Kde e-shopy plýtvají nejvíc
Google v dokumentaci uvádí, že bez vašeho vedení se snaží projít všechny nebo většinu známých URL. A že správa „inventáře" URL je faktor, který můžete ovlivnit nejvíc. U e-shopů jde typicky o:
| Zdroj zbytečných URL | Příklad | Co s tím |
|---|---|---|
| Kombinace filtrů | /boty?barva=cerna&velikost=42&cena=1000-2000 | indexovat jen vybrané filtry, zbytek blokovat v robots.txt |
| Řazení a počet položek | ?sort=cena, ?limit=96 | neodkazovat, blokovat, canonical na čistou URL |
| Parametry kampaní a sledování | ?utm_source=, ?gclid= | neodkazovat interně, canonical |
| Soft 404 | prázdná kategorie nebo vyprodaný filtr s kódem 200 | vracet 404 nebo 410 |
| Řetězce přesměrování | stará URL → mezikrok → nová URL | odkazovat rovnou na cíl, zkrátit řetězce |
| Interní vyhledávání | /hledat?q=... | blokovat v robots.txt |
| Varianty produktu jako samostatné URL | každá barva a velikost zvlášť | sjednotit nebo canonical na hlavní produkt |
Fasetová navigace je největší položka. Google k ní vydal samostatný návod. Doporučuje procházení filtrovaných URL, které nepotřebujete ve vyhledávání, zakázat v robots.txt, protože crawler musí jinak velkou část z nich stáhnout, než zjistí, že jsou zbytečné. Pokud filtr funguje přes fragment URL (#barva=cerna), procházení neovlivní, protože fragmenty Google při procházení nepodporuje. Jak rozhodnout, které filtry si vlastní indexovatelnou stránku zaslouží, rozebíráme v článku Faceted navigation a SEO.
Jak změřit, kam Googlebot chodí
Statistiky procházení v Search Console
Přehled najdete v Search Console v Nastavení → Statistiky procházení. Ukazuje celkový počet požadavků, objem stažených dat a průměrnou dobu odezvy v čase. Požadavky rozděluje podle kódu odpovědi, typu souboru, účelu (objevování nových URL vs. obnova známých) a typu Googlebota. Stav hostitele říká, jestli Google za posledních 90 dní narazil na problémy s dostupností.
Na co se dívat:
- Podíl odpovědí 200. Za normálních okolností by měla převládat. Hodně 301 znamená, že odkazujete přes přesměrování. Hodně 5xx znamená problém se serverem.
- Doba odezvy. Když roste, Google podle dokumentace snižuje crawl capacity limit a prochází méně.
- Poměr objevování a obnovy. Pokud Google skoro jen obnovuje staré URL a nové neobjevuje, nové produkty se k němu nedostávají.
Logy serveru
Statistiky v Search Console jsou vzorek a neukážou konkrétní URL ve velkém. Přesný obraz dávají přístupové logy serveru. Stačí vyfiltrovat požadavky Googlebota (a ověřit, že jde o skutečného Googlebota, ne o podvržený user agent) a seskupit je podle typu URL. Často se ukáže, že polovina požadavků míří na parametry, o kterých nikdo nevěděl.
U SaaS platforem k logům přístup obvykle nemáte. Tam se opíráte o Search Console a o crawl vlastním nástrojem.
Jak Googlebot nasměrovat
Postup, který používáme, jde od nejsilnějšího zásahu k jemnému doladění:
- Nevytvářejte zbytečné URL. Nejlepší je URL, která nevznikne. Řazení a počet položek na stránku můžou fungovat bez změny URL nebo přes parametry, které neodkazujete.
- robots.txt pro to, co nemá procházet nikdo. Interní vyhledávání, kombinace filtrů, košík, porovnání. Pravidlo typu
Disallow: /*?*sort=zastaví procházení všech URL s řazením. - Canonical pro duplicity, které musí existovat. Canonical je signál pro indexaci, ne zákaz procházení. Google URL dál občas projde, ale sloučí signály na kanonickou verzi.
- Správné stavové kódy. Zrušený produkt bez náhrady: 404 nebo 410. Produkt s nástupcem: 301 na nástupce. Prázdná kategorie nesmí vracet 200 s textem „nic tu není".
- Čistá sitemap. Jen kanonické URL s kódem 200, bez parametrů. Hodnotu
lastmodGoogle používá, jen pokud je soustavně a ověřitelně přesná, takže ji nenastavujte na dnešní datum u všech URL. - Interní odkazy jen na kanonické URL. Menu, drobečková navigace i bloky „podobné produkty" mají odkazovat na cílovou adresu, ne přes přesměrování. Víc v hesle interní prolinkování.
Dvě věci, které nefungují, jak si lidé myslí. nofollow procházení nezastaví: pokud na stejnou URL vede jiný odkaz bez nofollow, Google ji projde. A noindex crawl budget přímo nešetří, protože Google musí stránku stáhnout, aby pravidlo viděl.
Rychlost serveru je součást crawl budgetu
Druhou polovinou rovnice je kapacita. Když server odpovídá rychle a bez chyb, Google si dovolí víc souběžných spojení. Když zpomalí nebo vrací chyby 5xx či 429, procházení omezí. Pomalý hosting tak neškodí jen zákazníkům a Core Web Vitals, ale i indexaci.
Pokud Googlebot server opravdu přetěžuje, Google doporučuje dočasně vracet kód 503 nebo 429. URL pak zkouší znovu zhruba dva dny. Pokud chyba trvá déle, začne URL vyřazovat z indexu. Je to nouzová brzda, ne řešení. Řešením je cache, výkonnější infrastruktura a méně zbytečných URL.
Jak na to prakticky: checklist pro velký katalog
- Zjistěte, kolik URL e-shop reálně generuje (crawl s parametry) a kolik z nich chcete v indexu.
- Projděte Statistiky procházení: podíl 200, 301 a 5xx, doba odezvy, poměr objevování a obnovy.
- Pokud máte přístup, analyzujte logy serveru podle typů URL.
- Sepište pravidla pro filtry: které mají vlastní indexovatelnou stránku a které se blokují.
- Upravte robots.txt a otestujte, že neblokuje produkty, kategorie ani CSS a JavaScript.
- Opravte soft 404 a zkraťte řetězce přesměrování.
- Vyčistěte sitemapy a nastavte pravdivé
lastmod. - Po nasazení sledujte měsíc vývoj procházení a indexace nových produktů.
Zásahy do robots.txt a filtrů jsou citlivé. Jedno špatné pravidlo umí z indexu vyřadit celé kategorie. Proto je u klientů nejdřív testujeme na crawlu a teprve pak nasazujeme. Pokud nové produkty naskakují do Googlu pomalu, začněte SEO auditem nebo se podívejte, jak pracujeme na SEO pro e-shopy. Rozsah a cenu připravíme po konzultaci podle velikosti katalogu.
Potřebujete s tím pomoct?