Embedding (vektorová reprezentace) a vektorové vyhledávání

Embedding (vektorová reprezentace) je převod textu — slova, věty, odstavce nebo celé stránky — na řadu čísel, která zachycuje jeho význam. Vektorové vyhledávání pak hledá texty, jejichž čísla jsou si nejblíž, a nachází tak obsah podle smyslu, ne podle shody slov.

Pro majitele webu je to podstatné ze dvou důvodů. Na tomhle principu stojí to, jak si AI vyhledávače vybírají stránky, ze kterých skládají odpověď. A vysvětluje, proč opakování přesných frází už nepomáhá, zatímco mlhavý text bez konkrétních faktů prohrává i tehdy, když obsahuje všechna správná slova.

Co vektorové vyhledávání umí a co ne

Představte si knihovnu, kde knihy nestojí podle abecedy, ale podle obsahu. Vedle sebe jsou ty, které pojednávají o tomtéž, i když mají úplně jiný název. Hledání pak znamená dojít na místo, kam by patřila vaše otázka, a podívat se, co stojí okolo. Přesně tohle dělá vektorové vyhledávání — jen s miliony pasáží a ve stovkách až tisících rozměrů místo regálů.

Co umí

Význam
  • +Najít text, který odpovídá smyslu dotazu, i bez shodných slov
  • +Spojit synonyma, parafráze a u vícejazyčných modelů i různé jazyky
  • +Rozlišit význam slova podle kontextu věty

Co neumí

Limity
  • −Spolehlivě rozlišit přesné kódy, čísla modelů a podobné názvy značek
  • −Posoudit, jestli je text pravdivý, aktuální nebo kvalitní
  • −Rozhodnout, kterou stránku AI nakonec ocituje — to je až další krok
⚠️

Skóre podobnosti z nástroje není hodnoticí faktor

Některé SEO nástroje počítají, jak „blízko“ je vaše stránka k dotazu, a vrací číslo. To číslo platí jen pro model, který nástroj použil, a jiný model vrátí jiné hodnoty. Přepisovat texty, dokud skóre nevyleze nad určitou hranici, je nová verze honby za hustotou klíčových slov — práce, za kterou zaplatíte a která sama o sobě nic nezaručí.

Jak vektorové vyhledávání funguje

Princip je stejný v AI vyhledávačích i v interním vyhledávání na webu. Liší se jen modely a to, co se děje s nalezenými pasážemi dál.

Krok Co se děje
1. Rozdělení Obsah se rozdělí na části — stránky, odstavce nebo pasáže.
2. Převod na vektory Model převede každou část na embedding a uloží ho do vektorové databáze.
3. Převod dotazu Stejný model převede na vektor i dotaz uživatele.
4. Hledání nejbližších Systém najde pasáže, jejichž vektory leží nejblíž vektoru dotazu.
5. Další zpracování Nalezené pasáže se seřadí dalšími signály, nebo je dostane jazykový model jako podklad pro odpověď — to je princip RAG.

Nejčastější měřítko blízkosti je kosinová podobnost (cosine similarity). Porovnává směr dvou vektorů: čím víc míří stejným směrem, tím blíž je hodnota jedničce a tím podobnější je význam.

Jak vypadá embedding

# text → vektor (zkráceno, reálně stovky až tisíce čísel) „sprchový kout do podkroví“ → [0.021, -0.113, 0.087, … ] „koupelna se šikmým stropem“ → [0.019, -0.098, 0.091, … ] „zimní pneumatiky“ → [-0.143, 0.052, -0.012, … ]

Čísla jsou ilustrativní. Smysl je v tom, že první dva texty dostanou podobné vektory, přestože nesdílejí jediné slovo, a třetí skončí daleko. Jednotlivé rozměry nemají lidsky srozumitelný význam.

Embedding v Googlu a v AI vyhledávačích

Google začal porovnávat významy místo slov dávno před AI odpověďmi. V roce 2018 nasadil neural matching, o rok později BERT. Oba systémy stojí na stejné myšlence jako embedding: dotaz i stránka se převedou do podoby, ve které se dají porovnat podle smyslu.

Neural matching je systém umělé inteligence, který Google používá k pochopení reprezentací pojmů v dotazech a na stránkách a k jejich vzájemnému párování.

Zdroj: Google Search Central, průvodce systémy hodnocení (vlastní překlad)

Google zároveň zdůrazňuje, že žádný z těchto systémů nepracuje sám, ale jako součást většího souboru. Google sám označuje neural matching za systém pro vyhledání relevantních stránek — významová blízkost tedy pomáhá hlavně s výběrem kandidátů, o pořadí rozhoduje celý soubor signálů. V průvodci optimalizací pro AI funkce Google výslovně uvádí, že jeho systémy rozumí synonymům i obecnému významu dotazu — a že proto není potřeba psát varianty textu pro každou formulaci ani rozsekávat obsah na malé kousky.

Co platí a co doložit nejde

Co platí. Embedding umísťuje podobné věci blízko sebe a moderní modely rozlišují význam slova podle kontextu. Google páruje významy dotazů a stránek od roku 2018 a sám uvádí, že na přesné shodě slov a pokrytí každé varianty dotazu nezáleží. Vektorové vyhledávání je podkladem, ze kterého AI vyhledávače vybírají zdroje pro odpověď.

Co doložit nejde. Který embedding model používá Google, ChatGPT nebo Perplexity a jak velké pasáže porovnávají, provozovatelé nezveřejňují. Hranice typu „pod 0,6 není stránka relevantní“ proto nemají obecnou platnost — hodnoty se mezi modely liší. Nedoložené je i tvrzení, že kratší text má automaticky lepší podobnost. Google uvádí, že ideální délka stránky neexistuje. Platí to i opačně: nikdo nedoložil, že by na struktuře textu pro vyhledávání nezáleželo vůbec.

Praktický závěr funguje bez ohledu na model: sekce, která se drží jednoho tématu a odpovídá konkrétně, je srozumitelnější pro čtenáře i pro jakýkoli systém, který s ní pracuje. Na přesném čísle podobnosti stavět nemá smysl.

Jak psát obsah, který se dobře najde

Jedna sekce, jedno téma

Když se v jednom odstavci mísí cena, montáž a reklamace, není jasné, na co odpovídá. Nadpis, který pojmenuje otázku, a odpověď hned pod ním pomůže čtenáři i strojům.

Konkrétní názvy, čísla a kódy

Přesné označení produktu, rozměry a značky vypisujte doslova. Tady vektorové vyhledávání tápe a na řadu přichází klasická shoda slov.

Ne: „kvalitní kout pro menší koupelny“ Ano: „sprchový kout 80 × 80 cm, sklo 6 mm“

Psát slovy zákazníka

Synonyma systém pochopí, ale text psaný interní terminologií firmy se od otázek zákazníků vzdaluje i významově.

Faktická tvrzení místo obecných frází

„Komplexní řešení pro váš domov“ nemá žádný význam, ke kterému by se dalo přiblížit. „Montáž do 14 dnů po celé ČR“ má.

Nepsat varianty pro synonyma

Jedna dobrá stránka pokryje „kout“, „sprchovou zástěnu“ i „sprchu do koupelny“. Tři skoro stejné stránky si jen konkurují.

Vyzkoušet si podobnost sami

Pro zvídavé: pár řádků v Pythonu porovná dotaz s vašimi odstavci. Výsledek berte jako orientaci, ne jako cíl.

from openai import OpenAI import numpy as np texty = ["dotaz", "odstavec A", "odstavec B"] r = OpenAI().embeddings.create(model="text-embedding-3-small", input=texty) v = [np.array(d.embedding) for d in r.data] cos = lambda a, b: a @ b / (np.linalg.norm(a) * np.linalg.norm(b)) print([round(float(cos(v[0], x)), 3) for x in v[1:]])

Nejčastější chyby z našich auditů

Varianty

Stránka pro každou formulaci dotazu

Systémy, které rozumí významu, je stejně spojí. Výsledkem je kanibalizace a ve velkém i riziko porušení pravidel proti spamu.

Mýtus

„LSI klíčová slova“ jako sémantické SEO

LSI je stará statistická metoda a Google ji nepoužívá. Seznam „souvisejících slov“ vložený do textu embedding nijak nezlepší.

Skóre

Přepisování textu podle čísla z nástroje

Hodiny ladění, dokud podobnost nepřekročí 0,8. Jiný model vrátí jiné číslo a čtenáři to nepomůže.

Obsah

Marketingové fráze bez faktů

Texty plné „kvality“, „komplexnosti“ a „individuálního přístupu“ leží významově všude a nikde. Na konkrétní dotaz nejsou nejblíž.

Struktura

Rozsekání stránek kvůli AI

Google uvádí, že dělit obsah na drobné kousky kvůli AI není potřeba. Pomáhají srozumitelné sekce, ne fragmenty bez kontextu.

Detaily

Chybějící přesná označení produktů

Kód modelu jen v obrázku nebo v PDF. Kdo hledá přesně ten model, stránku nenajde ani fulltextem, ani podle významu.

Časté dotazy

Jaký je rozdíl mezi embeddingem a klíčovým slovem?

Klíčové slovo je konkrétní řetězec znaků, který se buď shoduje, nebo ne. Embedding je číselný otisk významu celé pasáže, který se porovnává s otiskem dotazu. Klíčová slova ale nezmizela — ukazují, jak se lidé ptají, a u přesných názvů a kódů rozhodují dál.

Používá Google vektorové vyhledávání?

Google popisuje systémy jako neural matching a BERT, které párují významy dotazů a stránek — to je stejný princip. Konkrétní modely a jejich nastavení ale nezveřejňuje. Jisté je, že tyto systémy pracují společně s dalšími signály, ne samostatně.

Rozumí embedding češtině?

Vícejazyčné modely ano, kvalita se ale mezi modely i jazyky liší. Proto se vyplatí v textu používat i základní tvary důležitých výrazů a přesné názvy, které nezávisí na tom, jak dobře model zvládá jazyk.

Musím si embeddingy pro svůj web počítat?

Pro SEO ne. Vyhledávače si je počítají samy a do jejich modelů nevidíte. Vlastní výpočet má smysl pro interní vyhledávání na webu, doporučování produktů nebo jako diagnostická pomůcka při auditu obsahu.

Je embedding totéž co sémantické SEO?

Ne. Embedding je technika, kterou vyhledávače používají. „Sémantické SEO“ je označení pro psaní, které cílí na témata a význam místo jednotlivých frází — a obsahově se překrývá s tím, co dobrý obsah dělal vždycky.

🧭

Nevíte, proč vás AI nenachází, i když máte „všechna klíčová slova“?

Projdeme klíčové stránky a ukážeme, kde text odpovídá na jinou otázku, než jakou zákazníci kladou, a kde chybí konkrétní fakta. Bez závazku.

Termín si vyberete v kalendáři.

Michal Binka, SEO PRAKTICKY

Autor článku

Michal Binka

Zakladatel SEO PRAKTICKY s.r.o.

Vektorové vyhledávání zní jako téma pro vývojáře, ale jeho důsledky jsou hlavně redakční: konkrétní text vyhrává nad textem napěchovaným frázemi. Do technických detailů se vyplatí jít jen tak daleko, aby se nezačalo optimalizovat na čísla z nástrojů.

Přes 20 let se věnuje SEO pro české e-shopy, je autorem tří knih o SEO a Zlatým Shoptet Partnerem. Přednáší na oborových konferencích a vede tým specialistů v Brně.

  • Zlatý Shoptet Partner
  • Certifikovaný specialista Collabim
  • Autor tří knih o SEO

Zdroje

Konkrétní embedding modely, které používají vyhledávače a AI asistenti, jejich provozovatelé nezveřejňují. Názvy modelů v ukázce kódu se mění — před použitím si ověřte aktuální dokumentaci poskytovatele.