Duplicitní obsah v e-shopu: příčiny a řešení
Filtry, varianty, parametry z kampaní i převzaté popisy od dodavatele. Ukážeme, kde duplicity vznikají, jak je najít v Search Console a který nástroj na kterou situaci použít.
Duplicitní obsah je v e-shopech normální stav, ne výjimka. Stačí jedna kategorie s řazením podle ceny, dva filtry a parametr z newsletteru, a z jedné stránky máte desítky URL. K tomu produkty zařazené ve třech kategoriích, varianty se stejným textem a popisy, které dodavatel rozeslal všem obchodům stejně.
Dobrá zpráva: Google za to netrestá. Špatná zpráva: duplicity přesto stojí pozice, čas robota i přehlednost v Search Console. V článku projdeme, kde duplicity v e-shopu vznikají, jak je najít a který nástroj na kterou situaci použít.
Co Google s duplicitami skutečně dělá
Google o „penalizaci za duplicitní obsah“ píše už od roku 2008 na blogu Search Central stejně: duplicity na webu nejsou důvodem k zásahu, pokud nejsou zjevně vytvořené, aby klamaly a manipulovaly výsledky. Co se děje místo toho:
- Google stránky se stejným nebo velmi podobným obsahem seskupí do jedné skupiny.
- Z ní vybere jednu reprezentativní, tzv. kanonickou URL, a tu zobrazuje ve výsledcích.
- Signály ostatních URL, třeba odkazy, se snaží přičíst té kanonické.
Problém tedy není trest, ale ztráta kontroly. Google může vybrat jinou URL, než chcete, třeba verzi s parametrem ?sort=price. Odkazy se rozptýlí mezi varianty. A robot tráví čas procházením kopií místo nových produktů. U velkých katalogů to souvisí s crawl budgetem, kterému se věnujeme v článku Crawl budget a velké e-shopy.
Odkud se duplicity v e-shopu berou
| Zdroj | Příklad | Typické řešení |
|---|---|---|
| Parametry v URL | ?utm_source=newsletter, ?sort=cena, ?page_size=48 | canonical na čistou URL |
| Filtry (fasetová navigace) | /boty?barva=cerna&velikost=42 | canonical, u nekonečných kombinací robots.txt |
| Varianty produktu | každá barva na vlastní URL se stejným textem | canonical na hlavní produkt, nebo vlastní obsah varianty |
| Produkt ve více kategoriích | /panske/boty-x a /vyprodej/boty-x | jedna URL produktu bez kategorie v cestě |
| Stránkování | /boty?page=2 | canonical sama na sebe, ne na první stranu |
| http/https, www/bez www, lomítko | http://eshop.cz/boty/ vs. https://www.eshop.cz/boty | 301 na jednu verzi |
| Tiskové a alternativní verze | /produkt/print, ?format=pdf | canonical, u souborů v HTTP hlavičce |
| Převzaté popisy od dodavatele | stejný text u desítek e-shopů | vlastní text u důležitých produktů |
| Tagy a štítky vs. kategorie | štítek „černé boty“ se stejným výpisem jako filtr | sloučit, nebo noindex u prázdných štítků |
Nejvíc duplicit obvykle vyrábí filtrace. Jak ji nastavit, aby z ní vznikaly jen užitečné vstupní stránky, rozebíráme v článku Faceted navigation a SEO.
Duplicity, které nejsou v URL
Zvláštní kapitola jsou texty. Když dodavatel pošle popis produktu do XML feedu a ten samý text použije každý jeho odběratel, vzniká duplicita napříč weby. Google ji neřeší sankcí. Z desítek stejných stránek ale ve výsledcích ukáže jen několik a nemusí to být ta vaše. U vlastní kategorie a u produktů, které tvoří tržby, se proto vyplatí text přepsat nebo doplnit o vlastní informace: zkušenosti, rozměrovou tabulku, srovnání s podobnými modely.
Podobně dopadají kategorie s téměř stejným výpisem produktů, například „Pánské boty“ a „Boty pro muže“ vzniklé historicky dvakrát. Tady nepomůže canonical, ale sloučení a 301 přesměrování.
Nástroje: co kdy použít
Nástroje nejsou zaměnitelné. Každý dělá něco jiného a jejich kombinace se může vyrušit.
| Nástroj | Co udělá | Kdy ho použít | Na co pozor |
|---|---|---|---|
| 301 přesměrování | stará URL přestane existovat, návštěvník i robot skončí na nové | http na https, www, lomítka, sloučené kategorie, migrace | nepoužívejte tam, kde varianta musí zůstat dostupná |
rel="canonical" | stránka zůstane dostupná, Google dostane silný signál, kterou URL indexovat | parametry, filtry, varianty, tiskové verze | je to nápověda, ne příkaz |
noindex | stránka se nezobrazí ve výsledcích | interní vyhledávání, prázdné štítky, účet, košík | neslučuje signály; nekombinujte s canonical na jinou URL |
| robots.txt | robot URL vůbec neprochází | nekonečné kombinace filtrů, parametry bez hodnoty | Google pak nevidí canonical ani noindex |
Podrobný výklad značky, včetně toho, jak Google váží jednotlivé signály, najdete v hesle canonical. Důležité je, aby všechny signály ukazovaly stejným směrem. Canonical ukazuje na URL A, ale menu, drobečková navigace a sitemap odkazují na URL B? Google si pak může vybrat B. Proto k úklidu duplicit patří i kontrola interního prolinkování.
Nejčastější chyby, které vidíme
- Canonical všech stran stránkování na první stranu. Google výslovně doporučuje, aby každá strana měla canonical sama na sebe.
noindexa zároveň canonical na jinou URL. Dva protichůdné signály.- Duplicitní URL zablokované v robots.txt, přestože mají canonical. Robot ho nikdy neuvidí.
- Canonical na URL, která přesměrovává nebo vrací 404.
- Sitemap plná parametrických URL. Do sitemap patří jen kanonické adresy.
Jak duplicity najít v Search Console
Nejrychlejší zdroj je přehled Stránky (dříve Pokrytí) v Google Search Console. V části „Proč stránky nejsou indexovány“ hledejte tyto stavy:
| Stav v Search Console | Co znamená | Co dělat |
|---|---|---|
| Alternativní stránka se správnou kanonickou značkou | duplicita s canonical, kterou Google respektuje | nic, takhle to má být |
| Duplicitní stránka bez kanonické verze vybrané uživatelem | Google našel duplicitu a canonical si vybral sám | doplnit canonical, pokud výběr Googlu nesedí |
| Duplicitní, Google zvolil jinou kanonickou stránku než uživatel | vaši značku Google přebil jinými signály | sjednotit odkazy, sitemap a přesměrování |
U konkrétní URL pak v nástroji Kontrola URL porovnejte „kanonickou URL deklarovanou uživatelem“ a „kanonickou URL vybranou Googlem“. Když se liší u důležitých stránek, máte v signálech rozpor.
Search Console ukazuje jen část obrazu. Doplňte ji crawlem celého webu vlastním nástrojem: najdete skupiny stránek se stejným titulkem, H1 nebo obsahem, i když je Google zatím neprošel.
Jak na to prakticky: postup v 6 krocích
- Sjednoťte doménu. Jedna verze (https, s www nebo bez, s lomítkem nebo bez) a 301 ze všech ostatních.
- Nastavte pravidla pro šablony. Pro kategorie, filtry, stránkování, varianty a produkty ve více kategoriích sepište, co je kanonické. Na krabicových platformách ověřte, co šablona generuje sama.
- Rozhodněte o filtrech. Které kombinace mají vlastní poptávku a zaslouží si indexaci, a které ne. Nekonečné kombinace omezte v robots.txt.
- Vyčistěte sitemap a interní odkazy. Jen kanonické URL, žádné parametry.
- Sloučte skutečné duplicity. Dvě kategorie se stejným obsahem spojte a starou přesměrujte 301.
- Přepište texty tam, kde to vydělá. Nejprodávanější produkty a hlavní kategorie mají dostat vlastní popis.
Po změnách počítejte s tím, že se přehledy v Search Console mění postupně podle toho, jak Google stránky znovu prochází. Celý kontext technického SEO shrnuje checklist technického SEO e-shopu.
Kdy nám zavolat
Duplicity se obvykle neobjeví najednou. Přibývají s každým novým filtrem, pluginem nebo kampaní. Pokud v Search Console roste počet duplicitních stránek, Google u důležitých URL vybírá jinou kanonickou verzi nebo chystáte migraci, projdeme to s vámi. V rámci SEO pro e-shopy uděláme crawl, porovnáme ho se Search Console a připravíme pravidla pro šablony. Jednooblastní SEO audit obvykle trvá 5–10 dnů.
Potřebujete s tím pomoct?