Převeďshop.cz
AI pro e-shopy

AI párování produktů mezi dodavatelem a e-shopem

22. 9. 2026 5 min čteníTým Převeďshop.cz

Stejný produkt, tři dodavatelé, tři různé názvy a jeden chybějící EAN. Ukážeme, jak párování postavit ve vrstvách, aby AI pomáhala a nevyráběla duplicity.

Párování produktů je tichý základ každého e-shopu, který bere zboží od více dodavatelů. Když nový feed obsahuje produkt, musíte vědět, jestli ho už prodáváte. Pokud ano, aktualizujete cenu a sklad. Pokud ne, zakládáte nový. Chyba v jednom směru vyrobí duplicitu, v druhém přepíše cizí produkt špatnými daty. Oboje zákazník uvidí.

S jedním dodavatelem to jde přes jeho kód produktu. S pěti dodavateli, kteří prodávají částečně stejné zboží, už ne. Stejný produkt přijde pod třemi názvy, jednou s EAN, jednou bez a jednou s EAN krabice po šesti kusech. V článku ukazujeme, jak párování stavíme ve vrstvách a kde v nich dává smysl AI.

Vrstva 1: identifikátory a jejich validace

Nejspolehlivější je shoda globálního identifikátoru. GTIN, v Evropě nejčastěji ve formě EAN-13, přiděluje výrobce podle standardu GS1 a konkrétní produkt jím jednoznačně označuje. Než mu ale uvěříte, validujte ho:

  • Kontrolní číslice. Poslední číslice se počítá modulo 10 se střídavými vahami 3 a 1. Odhalí všechny překlepy v jedné číslici a většinu prohozených sousedních číslic.
  • Vyhrazené prefixy. Kódy začínající 2, 02 nebo 04 jsou určené pro interní oběh (třeba vážené zboží v obchodě). Google Merchant Center je jako GTIN odmítne a pro párování mezi dodavateli nejsou spolehlivé.
  • Zjevné nesmysly. Nuly, stejné číslo u stovek produktů, EAN zkopírovaný do pole pro kód dodavatele.

Pozor na balení. Podle pravidel GS1 má jiné balení (například karton po šesti kusech) jiný GTIN než jednotlivý kus. Když jeden dodavatel posílá EAN kusu a druhý EAN kartonu, shoda nevznikne, i když jde o stejný produkt. Tady pomůže další vrstva.

Druhým silným identifikátorem je kombinace značka + kód výrobce (MPN). Je spolehlivá, jen když obě části normalizujete: velká písmena, bez mezer a pomlček, sjednocený zápis značky („Bosch“, „BOSCH“, „Robert Bosch“).

Vrstva 2: fuzzy matching na normalizovaných datech

Když identifikátor chybí, porovnávají se texty. Fuzzy matching měří, jak moc se dva řetězce liší, například podle počtu úprav nebo shody trojic znaků. Funguje dobře na drobné rozdíly v zápisu: „Makita DHP482Z“ a „Makita DHP 482 Z aku vrtačka“.

Aby fungoval, je potřeba data nejdřív normalizovat:

  • sjednotit jednotky a zápisy čísel („0,5 l“, „500 ml“, „0.5L“),
  • vytáhnout z názvu značku, model a variantní údaje do samostatných polí,
  • odstranit marketingové přívlastky dodavatele („AKCE“, „novinka“, „SKLADEM“).

Fuzzy matching má ale slepé místo. Dva různé produkty s podobným názvem („… 18 V, 2 Ah“ a „… 18 V, 4 Ah“) vyjdou jako skoro stejné. Rozdíl jedné číslice je pro algoritmus malý, pro zákazníka zásadní.

Vrstva 3: embeddingy a jazykový model

Embedding modely převádějí text na vektor podle významu. Najdou shodu i tam, kde se názvy liší úplně, třeba mezi „Sluchátka přes hlavu bezdrátová ANC“ a „Bluetooth headset s aktivním potlačením hluku“. Hodí se hlavně jako rychlé vyhledání kandidátů: pro každý produkt z feedu najdou deset nejpodobnějších v katalogu.

Finální rozhodnutí pak dělá jazykový model. Dostane produkt z feedu, kandidáty a jejich parametry a odpoví ve strukturovaném formátu: který kandidát je shoda, nebo že shoda neexistuje, a s jakou jistotou. Model umí to, co fuzzy matching ne: pochopit, že „2 Ah“ a „4 Ah“ jsou jiné produkty, a že „černá“ a „black“ jsou stejná barva.

AI má ale i riziko opačného směru. Může „dohledat“ shodu tam, kde žádná není, protože kandidát vypadá dost podobně. Proto do promptu vždy dáváme výslovnou možnost „žádná shoda“ a u rozhodnutí vyžadujeme srovnání klíčových parametrů.

Rozhodovací tabulka

Vrstvy se skládají do jednoduchého rozhodování. Takhle vypadá typické nastavení, konkrétní prahy se ladí na vašich datech:

SituaceRozhodnutí
Platný GTIN se shoduje a značka sedíAutomatická shoda
Shoda značky a normalizovaného MPNAutomatická shoda, namátková kontrola
GTIN se shoduje, ale značka nebo kategorie neKe kontrole, často chyba v datech dodavatele
Bez identifikátoru, model s vysokou jistotou, parametry sedíKe kontrole nebo automaticky podle naměřené přesnosti
Model s nízkou jistotou nebo více podobných kandidátůRuční rozhodnutí
Žádný kandidátNový produkt, projde kategorizací a obohacením

Každé ruční rozhodnutí ukládejte jako pravidlo (tento kód dodavatele = tento produkt). Příště už se nepáruje, jen se použije uložená vazba.

Varianty: párujte kus, ne skupinu

Nejvíc chyb vzniká u variant. Dodavatel posílá tričko jako jednu položku se seznamem velikostí, e-shop má každou velikost jako samostatnou variantu. Nebo naopak. V Google Merchant Center mají varianty společné item_group_id, ale každá má vlastní ID a v ideálním případě vlastní GTIN. Na Heurece plní stejnou roli ITEMGROUP_ID.

Postup, který funguje:

  1. Najděte odpovídající produktovou skupinu (model trička).
  2. Normalizujte variantní atributy: velikosti („XL“, „xl“, „42“ podle tabulky výrobce), barvy („antracit“ vs. „tmavě šedá“).
  3. Párujte konkrétní varianty podle atributů, ne podle pořadí nebo názvu.
  4. Varianty, které u vás chybí, založte do existující skupiny, ne jako nový produkt.

Podrobněji o zpracování variant píšeme v článku Varianty produktů ve feedech.

Duplicity: prevence je levnější než úklid

Duplicita vzniká, když párování shodu nenajde a produkt se založí podruhé. Na webu pak máte dvě stránky se stejným zbožím, rozdělené recenze a ve srovnávačích dvě nabídky. Úklid znamená slučování, přesměrování a opravu historie objednávek.

Proto u nových produktů z feedu děláme ještě jednu kontrolu před založením: znovu hledáme podobné produkty v celém katalogu, ne jen v kandidátech od stejného dodavatele. Pokud už duplicity v katalogu máte, jejich hledání a slučování popisujeme v článku Deduplikace produktů při více zdrojích dat.

Kde párování běží

Párování je jeden krok v importu feedu, typicky mezi stažením XML feedu a zápisem do e-shopu. Technicky jde o ETL proces: načíst, normalizovat, spárovat, zapsat. Vazby mezi kódy dodavatelů a vašimi produkty patří do vlastní tabulky nebo do PIM, ne do poznámky u produktu. Díky tomu přežijí změnu dodavatele, migraci i přejmenování produktu.

Nezapomeňte na historii. Když se spárování ukáže jako chybné, potřebujete vědět, kdy vzniklo, kdo nebo co ho schválilo a jaká data se kvůli němu přepsala.

Jak na to prakticky

  1. Zmapujte, jaké identifikátory posílají vaši dodavatelé a jak kvalitní jsou.
  2. Zaveďte validaci GTIN a normalizaci značek, MPN a jednotek.
  3. Postavte vrstvy: identifikátory, fuzzy matching, embeddingy a jazykový model.
  4. Změřte přesnost na ručně spárovaném vzorku a nastavte prahy pro automatické schválení.
  5. Ruční rozhodnutí ukládejte jako trvalé vazby.
  6. Před založením nového produktu vždy zkontrolujte duplicity v celém katalogu.

Párování stavíme jako součást napojení dodavatelů a feedů, jednorázová implementace začíná od 3 000 Kč za dodavatele. Samotnou AI vrstvu pro složitější katalogy řešíme v rámci služby AI párování produktů, cenu připravíme po konzultaci podle rozsahu. Pošlete nám ukázku feedů a řekneme, kolik produktů se dá spárovat automaticky.

Zpět na blog

Často kladené dotazy

EAN je nejsilnější identifikátor, ale nestačí. Část produktů ho nemá, dodavatelé posílají chybné nebo neplatné kódy a u variant se EAN někdy přiřadí celé skupině. EAN proto nejdřív validujte kontrolní číslicí a pro produkty bez něj použijte další vrstvy párování.

Mohlo by vás zajímat

Máte e-shop a nevíte, kde s růstem začít?

Nezávazná konzultace vám ukáže konkrétní příležitosti — technické, marketingové i obchodní.