Chunking / passage-level retrieval
Chunking je rozdělení textu na menší části — pasáže neboli chunky —, se kterými pak pracuje vyhledávací systém. Passage-level retrieval znamená, že systém vyhledává a porovnává tyto pasáže, ne jen celé dokumenty. Díky tomu může jedna dobře napsaná sekce dlouhé stránky odpovědět na úzký dotaz, i když zbytek stránky je o něčem jiném.
Pro majitele webu z toho plyne praktický důsledek: AI odpovědi nečtou vaši stránku jako celek od začátku do konce, ale berou z ní konkrétní kusy. Sekce, která dává smysl jen v souvislosti s předchozím textem, se do odpovědi dostává hůř. Zároveň to ale neznamená, že máte web rozsekat na útržky — to Google výslovně nedoporučuje.
Co v článku najdete
Co chunking je a co není
Chunking připomíná rejstřík na konci odborné knihy. Neodkazuje jen na knihu jako celek, ale na konkrétní stranu a odstavec, kde se o věci píše. Kniha přitom zůstává celá — nikdo ji kvůli rejstříku nerozstříhal na lístečky. Totéž platí pro web: dělení na pasáže je práce vyhledávacího systému, ne autora.
Co chunking je
Technika- +Krok, ve kterém systém dělí dokumenty na menší části
- +Důvod, proč může na úzký dotaz odpovědět jedna sekce dlouhé stránky
- +Standardní součást systémů postavených na RAG
Co chunking není
Omyl- −Úkol pro autora — rozsekat obsah na drobné kousky
- −Samostatný index pasáží v Googlu — ten indexuje celé stránky
- −Důvod psát krátké texty bez souvislostí
Přepis celého webu „na chunky“ je drahý a zbytečný
Google v průvodci optimalizací pro AI výslovně uvádí, že rozdělovat obsah na drobné kousky kvůli AI není potřeba. Kdo zaplatí za rozsekání článků na desítky krátkých bloků bez souvislostí, často zhorší čtenost pro lidi a pro vyhledávání nezíská nic doloženého. Smysl má upravit sekce, které bez kontextu nedávají smysl — ne přepisovat všechno.
Jak systémy s pasážemi pracují
„Pracovat s pasážemi“ neznamená u všech systémů totéž. Google řadí stránky a pasáže mu pomáhají posoudit jejich relevanci. Systémy postavené na RAG vyhledávají přímo jednotlivé kusy textu a ty předávají jazykovému modelu.
| Systém | Jak s pasážemi pracuje |
|---|---|
| Vyhledávání Google | Hodnotí stránky. Passage ranking rozpozná jednotlivé sekce, aby lépe pochopil, jak je stránka pro dotaz relevantní. |
| AI Overviews a AI Mode | Z vyhledaných stránek berou konkrétní informace, ze kterých skládají odpověď, a odkazují na zdrojové stránky. |
| RAG systémy obecně | Dělí dokumenty na chunky, převádějí je na vektory a vyhledávají nejpodobnější z nich. |
| ChatGPT, Perplexity a další | Jak přesně dělí a vybírají pasáže, provozovatelé veřejně nepopisují. |
Jak takové dělení vypadá v praxi, ukazuje veřejně zdokumentovaný nástroj Google Cloud pro firemní RAG aplikace. Text rozdělí na úseky pevné délky, které se částečně překrývají, aby se myšlenka na hranici dvou úseků neztratila.
Vertex AI RAG Engine — výchozí nastavení
Menší úseky znamenají přesnější, ale užší embeddingy, větší úseky obecnější, ve kterých se mohou ztratit detaily. Je to nastavení jednoho konkrétního nástroje, ne pravidlo, podle kterého pracuje Google Search nebo ChatGPT. Dělí se podle počtu tokenů, ne podle vašich nadpisů.
Co k tomu říká Google
Google popisuje passage ranking jako systém, který rozpozná jednotlivé sekce stránky, aby lépe pochopil, nakolik je stránka relevantní. Zároveň uvádí, že jeho systémy hodnocení pracují na úrovni stránek. Pasáže tedy nejsou samostatné výsledky — jsou to podklady pro posouzení stránky.
Systémy Googlu dokážou pochopit nuance více témat na jedné stránce a ukázat uživatelům relevantní část.
Zdroj: Google Search Central, průvodce optimalizací pro generativní AI (vlastní překlad)
Ve stejném průvodci Google dodává, že ideální délka stránky neexistuje a že kratší i delší stránky mohou fungovat podle tématu a publika. Pro AI Overviews a AI Mode přitom platí stejné požadavky jako pro běžné vyhledávání: stránka musí být v indexu a způsobilá k zobrazení s úryvkem.
Co platí a co doložit nejde
Co platí. Google řadí stránky a pasáže využívá k posouzení jejich relevance. Systémy postavené na RAG dělí dokumenty na úseky a vyhledávají v nich — u veřejně zdokumentovaných nástrojů podle počtu tokenů s překryvem. Google výslovně uvádí, že rozsekávat obsah kvůli AI není potřeba a ideální délka stránky neexistuje.
Co doložit nejde. Často citovaná „ideální délka pasáže“ — 40–75 slov, 50–150 slov a podobně — pochází z analýz prodejců nástrojů bez zveřejněné metodiky. Nedoložené je i tvrzení, že každý nadpis H2 tvoří jeden chunk: veřejně popsané systémy dělí text podle délky, ne podle struktury. Jak dělí obsah ChatGPT, Perplexity nebo Gemini, provozovatelé nezveřejňují. Platí to i opačně: nikdo nedoložil, že by na tom, jak je sekce napsaná, nezáleželo.
Praktický závěr platí bez ohledu na to, jak konkrétní systém text dělí: sekce, která dává smysl i vytržená z kontextu, obstojí v každém z nich. A čtenáři, který na stránku přijde přes odkaz na konkrétní místo, pomůže úplně stejně.
Jak psát sekce, které obstojí samostatně
Pojmenovat věc, ne odkazovat zájmenem
Pasáž vytržená z textu neví, kdo je „on“ nebo „tento produkt“. Opakovat podmět vypadá neelegantně, ale v jiném kontextu zachrání smysl.
Odpověď na začátek sekce
První věta pod nadpisem má odpovědět na otázku, kterou nadpis klade. Podrobnosti a výjimky až potom.
Nadpis, který řekne, o čem sekce je
Nadpis „Montáž a doprava“ nese informaci. Nadpis „Proč my?“ nenese žádnou.
Bez odkazů typu „jak jsme uvedli výše“
Klíčovou podmínku nebo číslo raději zopakujte. Systém, který pracuje s jedním úsekem, „výše“ nevidí.
Fakta v textu, ne v obrázku
Rozměry, ceny a podmínky v HTML textu nebo tabulce. Údaje schované v obrázku nebo v PDF se do textu stránky nedostanou.
Více podtémat na stránce je v pořádku
Stránka o koupelnových koutech může řešit rozměry, montáž i údržbu. Rozdělit ji kvůli AI na tři stránky není potřeba, když jsou sekce jasně oddělené.
Nejčastější chyby z našich auditů
Z jednoho průvodce dvacet mini stránek
Každá stránka má pár odstavců, žádná nepokryje téma a všechny si navzájem konkurují. Google pasáže najde i v jedné dlouhé stránce.
Sekce, která bez předchozí nedává smysl
„Druhá varianta je levnější“ — ale jaká první? Vytržená pasáž neodpoví na nic.
Sekce zkracované na předepsaný počet slov
Text ořezaný na „ideálních 60 slov“ podle tabulky z blogu. Žádný doložený limit neexistuje a z odpovědi vypadnou podstatné podmínky.
Pět témat v jednom odstavci
Cena, doprava, záruka a reklamace v jednom bloku textu. Ani čtenář, ani systém nepozná, kde začíná odpověď na jeho otázku.
Parametry jen v obrázku nebo v PDF
Technický list naskenovaný jako obrázek. Text stránky pak neobsahuje nic, co by šlo vybrat jako odpověď.
Nadpisy bez obsahu
„Úvod“, „Další informace“, „Závěr“. Neříkají, o čem sekce je, a nepomáhají nikomu, kdo hledá konkrétní odpověď.
Časté dotazy
Indexuje Google jednotlivé pasáže zvlášť?
Ne. Google indexuje a hodnotí celé stránky. Passage ranking mu pomáhá rozpoznat jednotlivé sekce a lépe posoudit, jak je stránka relevantní pro konkrétní dotaz. Starší označení „passage indexing“ bylo zavádějící.
Mám kvůli AI rozdělit dlouhé články na víc stránek?
Kvůli AI ne. Google uvádí, že dokáže pochopit více témat na jedné stránce a ukázat relevantní část. Dělit článek má smysl tehdy, když jednotlivé části odpovídají na úplně jiné potřeby čtenářů — ne proto, aby byly kratší.
Jak dlouhá má být jedna sekce?
Tak dlouhá, aby odpověděla na otázku z nadpisu včetně podmínek, které k odpovědi patří. Doložený ideální počet slov neexistuje. Rozumné je dát hlavní odpověď do první věty nebo dvou a podrobnosti až za ni.
Řídí se dělení textu mými nadpisy?
Nemusí. Veřejně popsané nástroje dělí text podle počtu tokenů s překryvem, ne podle nadpisů. Jak to dělají velké AI vyhledávače, není zveřejněné. Proto je bezpečnější, když smysl nese i samotný text sekce, ne jen nadpis nad ní.
Pomůže sekce s častými dotazy?
Dotaz s krátkou samostatnou odpovědí je přirozeně dobře vytržitelná pasáž, takže to dává smysl. Funguje to ale jen u skutečných otázek zákazníků s konkrétní odpovědí. Automaticky vygenerované otázky s obecnými odpověďmi nepomohou nikomu.
Chcete vědět, které vaše texty AI neumí použít?
Projdeme klíčové stránky a ukážeme sekce, které bez kontextu nedávají smysl, a místa, kde fakta chybí v textu. Navrhneme úpravy, ne přepis celého webu. Bez závazku.
Termín si vyberete v kalendáři.
Zdroje
- GOOGLE. A guide to Google Search ranking systems. Google Search Central [online]. Aktualizováno 10. 12. 2025 [cit. 2. 10. 2026]. Dostupné z: https://developers.google.com/search/docs/appearance/ranking-systems-guide
- GOOGLE. Optimizing your website for generative AI features on Google Search. Google Search Central [online]. Aktualizováno 10. 7. 2026 [cit. 2. 10. 2026]. Dostupné z: https://developers.google.com/search/docs/fundamentals/ai-optimization-guide
- GOOGLE CLOUD. Fine-tune RAG transformations. Vertex AI documentation [online]. Aktualizováno 26. 3. 2026 [cit. 2. 10. 2026]. Dostupné z: https://docs.cloud.google.com/vertex-ai/generative-ai/docs/rag-engine/fine-tune-rag-transformations
Způsob, jakým AI vyhledávače dělí a vybírají pasáže, jejich provozovatelé nezveřejňují. Výchozí hodnoty nástrojů pro RAG se mění s jejich verzemi — u konkrétních údajů si ověřte aktuální stav.

