Převeďshop.cz
SEO

Crawl budget a velké e-shopy: jak ho neplýtvat na filtry a duplicity

22. 9. 2026 6 min čteníTým Převeďshop.cz

Googlebot nemá na váš e-shop neomezený čas. Když ho utrácí za kombinace filtrů a řazení, nové produkty čekají na indexaci zbytečně dlouho. Ukážeme, jak zjistit, kam robot chodí, a jak ho nasměrovat.

E-shop přidá sto nových produktů. Za týden jsou v Googlu tři. Majitel se ptá, jestli je chyba v textech. Často není. Googlebot mezitím prošel desítky tisíc kombinací filtrů, řazení a stránkování a na nové produkty se nedostal.

Tomu se říká plýtvání crawl budgetem. Týká se hlavně velkých katalogů. Ale protože filtry umí z pár tisíc produktů udělat statisíce URL, potkáváme ho i u středně velkých e-shopů. V článku ukážeme, jak poznat, jestli se vás to týká, jak to změřit a co s tím dělat.

Co je crawl budget a koho se týká

Crawl budget je čas a zdroje, které Google věnuje procházení vašeho webu. Podle dokumentace Googlu ho určují dvě věci. Crawl capacity limit je, kolik souběžných spojení a jak rychle si Googlebot dovolí, aby server nepřetížil. Crawl demand je, jak moc o vaše URL stojí, podle jejich popularity, kvality a toho, jak rychle zastarávají. Podrobněji to vysvětlujeme v hesle crawl budget.

Google sám říká, že pokud web nemá velké množství rychle se měnících stránek nebo pokud nové stránky prochází ještě v den zveřejnění, jeho průvodce ke crawl budgetu číst nemusíte. Pro e-shop je to dobrý první test:

  • Zveřejněte nový produkt a sledujte v Search Console přes kontrolu URL, kdy ho Google poprvé procházel.
  • Pokud to trvá dny až týdny a v přehledu indexace roste počet stránek ve stavu „Objeveno – momentálně neindexováno", je čas se crawl budgetem zabývat.

Stav „Objeveno – momentálně neindexováno" znamená, že Google o URL ví, ale ještě ji nestáhl. To bývá signál, že procházení nestíhá. Stav „Procházeno – momentálně neindexováno" je jiný problém: Google stránku viděl a do indexu ji nezařadil, typicky kvůli slabému nebo duplicitnímu obsahu.

Kde e-shopy plýtvají nejvíc

Google v dokumentaci uvádí, že bez vašeho vedení se snaží projít všechny nebo většinu známých URL. A že správa „inventáře" URL je faktor, který můžete ovlivnit nejvíc. U e-shopů jde typicky o:

Zdroj zbytečných URLPříkladCo s tím
Kombinace filtrů/boty?barva=cerna&velikost=42&cena=1000-2000indexovat jen vybrané filtry, zbytek blokovat v robots.txt
Řazení a počet položek?sort=cena, ?limit=96neodkazovat, blokovat, canonical na čistou URL
Parametry kampaní a sledování?utm_source=, ?gclid=neodkazovat interně, canonical
Soft 404prázdná kategorie nebo vyprodaný filtr s kódem 200vracet 404 nebo 410
Řetězce přesměrovánístará URL → mezikrok → nová URLodkazovat rovnou na cíl, zkrátit řetězce
Interní vyhledávání/hledat?q=...blokovat v robots.txt
Varianty produktu jako samostatné URLkaždá barva a velikost zvlášťsjednotit nebo canonical na hlavní produkt

Fasetová navigace je největší položka. Google k ní vydal samostatný návod. Doporučuje procházení filtrovaných URL, které nepotřebujete ve vyhledávání, zakázat v robots.txt, protože crawler musí jinak velkou část z nich stáhnout, než zjistí, že jsou zbytečné. Pokud filtr funguje přes fragment URL (#barva=cerna), procházení neovlivní, protože fragmenty Google při procházení nepodporuje. Jak rozhodnout, které filtry si vlastní indexovatelnou stránku zaslouží, rozebíráme v článku Faceted navigation a SEO.

Jak změřit, kam Googlebot chodí

Statistiky procházení v Search Console

Přehled najdete v Search Console v Nastavení → Statistiky procházení. Ukazuje celkový počet požadavků, objem stažených dat a průměrnou dobu odezvy v čase. Požadavky rozděluje podle kódu odpovědi, typu souboru, účelu (objevování nových URL vs. obnova známých) a typu Googlebota. Stav hostitele říká, jestli Google za posledních 90 dní narazil na problémy s dostupností.

Na co se dívat:

  • Podíl odpovědí 200. Za normálních okolností by měla převládat. Hodně 301 znamená, že odkazujete přes přesměrování. Hodně 5xx znamená problém se serverem.
  • Doba odezvy. Když roste, Google podle dokumentace snižuje crawl capacity limit a prochází méně.
  • Poměr objevování a obnovy. Pokud Google skoro jen obnovuje staré URL a nové neobjevuje, nové produkty se k němu nedostávají.

Logy serveru

Statistiky v Search Console jsou vzorek a neukážou konkrétní URL ve velkém. Přesný obraz dávají přístupové logy serveru. Stačí vyfiltrovat požadavky Googlebota (a ověřit, že jde o skutečného Googlebota, ne o podvržený user agent) a seskupit je podle typu URL. Často se ukáže, že polovina požadavků míří na parametry, o kterých nikdo nevěděl.

U SaaS platforem k logům přístup obvykle nemáte. Tam se opíráte o Search Console a o crawl vlastním nástrojem.

Jak Googlebot nasměrovat

Postup, který používáme, jde od nejsilnějšího zásahu k jemnému doladění:

  1. Nevytvářejte zbytečné URL. Nejlepší je URL, která nevznikne. Řazení a počet položek na stránku můžou fungovat bez změny URL nebo přes parametry, které neodkazujete.
  2. robots.txt pro to, co nemá procházet nikdo. Interní vyhledávání, kombinace filtrů, košík, porovnání. Pravidlo typu Disallow: /*?*sort= zastaví procházení všech URL s řazením.
  3. Canonical pro duplicity, které musí existovat. Canonical je signál pro indexaci, ne zákaz procházení. Google URL dál občas projde, ale sloučí signály na kanonickou verzi.
  4. Správné stavové kódy. Zrušený produkt bez náhrady: 404 nebo 410. Produkt s nástupcem: 301 na nástupce. Prázdná kategorie nesmí vracet 200 s textem „nic tu není".
  5. Čistá sitemap. Jen kanonické URL s kódem 200, bez parametrů. Hodnotu lastmod Google používá, jen pokud je soustavně a ověřitelně přesná, takže ji nenastavujte na dnešní datum u všech URL.
  6. Interní odkazy jen na kanonické URL. Menu, drobečková navigace i bloky „podobné produkty" mají odkazovat na cílovou adresu, ne přes přesměrování. Víc v hesle interní prolinkování.

Dvě věci, které nefungují, jak si lidé myslí. nofollow procházení nezastaví: pokud na stejnou URL vede jiný odkaz bez nofollow, Google ji projde. A noindex crawl budget přímo nešetří, protože Google musí stránku stáhnout, aby pravidlo viděl.

Rychlost serveru je součást crawl budgetu

Druhou polovinou rovnice je kapacita. Když server odpovídá rychle a bez chyb, Google si dovolí víc souběžných spojení. Když zpomalí nebo vrací chyby 5xx či 429, procházení omezí. Pomalý hosting tak neškodí jen zákazníkům a Core Web Vitals, ale i indexaci.

Pokud Googlebot server opravdu přetěžuje, Google doporučuje dočasně vracet kód 503 nebo 429. URL pak zkouší znovu zhruba dva dny. Pokud chyba trvá déle, začne URL vyřazovat z indexu. Je to nouzová brzda, ne řešení. Řešením je cache, výkonnější infrastruktura a méně zbytečných URL.

Jak na to prakticky: checklist pro velký katalog

  • Zjistěte, kolik URL e-shop reálně generuje (crawl s parametry) a kolik z nich chcete v indexu.
  • Projděte Statistiky procházení: podíl 200, 301 a 5xx, doba odezvy, poměr objevování a obnovy.
  • Pokud máte přístup, analyzujte logy serveru podle typů URL.
  • Sepište pravidla pro filtry: které mají vlastní indexovatelnou stránku a které se blokují.
  • Upravte robots.txt a otestujte, že neblokuje produkty, kategorie ani CSS a JavaScript.
  • Opravte soft 404 a zkraťte řetězce přesměrování.
  • Vyčistěte sitemapy a nastavte pravdivé lastmod.
  • Po nasazení sledujte měsíc vývoj procházení a indexace nových produktů.

Zásahy do robots.txt a filtrů jsou citlivé. Jedno špatné pravidlo umí z indexu vyřadit celé kategorie. Proto je u klientů nejdřív testujeme na crawlu a teprve pak nasazujeme. Pokud nové produkty naskakují do Googlu pomalu, začněte SEO auditem nebo se podívejte, jak pracujeme na SEO pro e-shopy. Rozsah a cenu připravíme po konzultaci podle velikosti katalogu.

Potřebujete s tím pomoct?

Zpět na blog

Často kladené dotazy

Google uvádí, že průvodce je hlavně pro velmi velké a často se měnící weby. Pokud Google nové stránky prochází ještě v den zveřejnění, řešit to nemusíte. U e-shopu ale nerozhoduje počet produktů, nýbrž počet URL, které šablona generuje, a filtry jich umí vytvořit statisíce.

Mohlo by vás zajímat

Máte e-shop a nevíte, kde s růstem začít?

Nezávazná konzultace vám ukáže konkrétní příležitosti — technické, marketingové i obchodní.