Chunking / passage-level retrieval

Chunking je rozdělení textu na menší části — pasáže neboli chunky —, se kterými pak pracuje vyhledávací systém. Passage-level retrieval znamená, že systém vyhledává a porovnává tyto pasáže, ne jen celé dokumenty. Díky tomu může jedna dobře napsaná sekce dlouhé stránky odpovědět na úzký dotaz, i když zbytek stránky je o něčem jiném.

Pro majitele webu z toho plyne praktický důsledek: AI odpovědi nečtou vaši stránku jako celek od začátku do konce, ale berou z ní konkrétní kusy. Sekce, která dává smysl jen v souvislosti s předchozím textem, se do odpovědi dostává hůř. Zároveň to ale neznamená, že máte web rozsekat na útržky — to Google výslovně nedoporučuje.

Co chunking je a co není

Chunking připomíná rejstřík na konci odborné knihy. Neodkazuje jen na knihu jako celek, ale na konkrétní stranu a odstavec, kde se o věci píše. Kniha přitom zůstává celá — nikdo ji kvůli rejstříku nerozstříhal na lístečky. Totéž platí pro web: dělení na pasáže je práce vyhledávacího systému, ne autora.

Co chunking je

Technika
  • +Krok, ve kterém systém dělí dokumenty na menší části
  • +Důvod, proč může na úzký dotaz odpovědět jedna sekce dlouhé stránky
  • +Standardní součást systémů postavených na RAG

Co chunking není

Omyl
  • −Úkol pro autora — rozsekat obsah na drobné kousky
  • −Samostatný index pasáží v Googlu — ten indexuje celé stránky
  • −Důvod psát krátké texty bez souvislostí
⚠️

Přepis celého webu „na chunky“ je drahý a zbytečný

Google v průvodci optimalizací pro AI výslovně uvádí, že rozdělovat obsah na drobné kousky kvůli AI není potřeba. Kdo zaplatí za rozsekání článků na desítky krátkých bloků bez souvislostí, často zhorší čtenost pro lidi a pro vyhledávání nezíská nic doloženého. Smysl má upravit sekce, které bez kontextu nedávají smysl — ne přepisovat všechno.

Jak systémy s pasážemi pracují

„Pracovat s pasážemi“ neznamená u všech systémů totéž. Google řadí stránky a pasáže mu pomáhají posoudit jejich relevanci. Systémy postavené na RAG vyhledávají přímo jednotlivé kusy textu a ty předávají jazykovému modelu.

Systém Jak s pasážemi pracuje
Vyhledávání Google Hodnotí stránky. Passage ranking rozpozná jednotlivé sekce, aby lépe pochopil, jak je stránka pro dotaz relevantní.
AI Overviews a AI Mode Z vyhledaných stránek berou konkrétní informace, ze kterých skládají odpověď, a odkazují na zdrojové stránky.
RAG systémy obecně Dělí dokumenty na chunky, převádějí je na vektory a vyhledávají nejpodobnější z nich.
ChatGPT, Perplexity a další Jak přesně dělí a vybírají pasáže, provozovatelé veřejně nepopisují.

Jak takové dělení vypadá v praxi, ukazuje veřejně zdokumentovaný nástroj Google Cloud pro firemní RAG aplikace. Text rozdělí na úseky pevné délky, které se částečně překrývají, aby se myšlenka na hranici dvou úseků neztratila.

Vertex AI RAG Engine — výchozí nastavení

chunk_size: 1024 # délka úseku v tokenech chunk_overlap: 256 # kolik tokenů se s dalším úsekem překrývá

Menší úseky znamenají přesnější, ale užší embeddingy, větší úseky obecnější, ve kterých se mohou ztratit detaily. Je to nastavení jednoho konkrétního nástroje, ne pravidlo, podle kterého pracuje Google Search nebo ChatGPT. Dělí se podle počtu tokenů, ne podle vašich nadpisů.

Co k tomu říká Google

Google popisuje passage ranking jako systém, který rozpozná jednotlivé sekce stránky, aby lépe pochopil, nakolik je stránka relevantní. Zároveň uvádí, že jeho systémy hodnocení pracují na úrovni stránek. Pasáže tedy nejsou samostatné výsledky — jsou to podklady pro posouzení stránky.

Systémy Googlu dokážou pochopit nuance více témat na jedné stránce a ukázat uživatelům relevantní část.

Zdroj: Google Search Central, průvodce optimalizací pro generativní AI (vlastní překlad)

Ve stejném průvodci Google dodává, že ideální délka stránky neexistuje a že kratší i delší stránky mohou fungovat podle tématu a publika. Pro AI Overviews a AI Mode přitom platí stejné požadavky jako pro běžné vyhledávání: stránka musí být v indexu a způsobilá k zobrazení s úryvkem.

Co platí a co doložit nejde

Co platí. Google řadí stránky a pasáže využívá k posouzení jejich relevance. Systémy postavené na RAG dělí dokumenty na úseky a vyhledávají v nich — u veřejně zdokumentovaných nástrojů podle počtu tokenů s překryvem. Google výslovně uvádí, že rozsekávat obsah kvůli AI není potřeba a ideální délka stránky neexistuje.

Co doložit nejde. Často citovaná „ideální délka pasáže“ — 40–75 slov, 50–150 slov a podobně — pochází z analýz prodejců nástrojů bez zveřejněné metodiky. Nedoložené je i tvrzení, že každý nadpis H2 tvoří jeden chunk: veřejně popsané systémy dělí text podle délky, ne podle struktury. Jak dělí obsah ChatGPT, Perplexity nebo Gemini, provozovatelé nezveřejňují. Platí to i opačně: nikdo nedoložil, že by na tom, jak je sekce napsaná, nezáleželo.

Praktický závěr platí bez ohledu na to, jak konkrétní systém text dělí: sekce, která dává smysl i vytržená z kontextu, obstojí v každém z nich. A čtenáři, který na stránku přijde přes odkaz na konkrétní místo, pomůže úplně stejně.

Jak psát sekce, které obstojí samostatně

Pojmenovat věc, ne odkazovat zájmenem

Pasáž vytržená z textu neví, kdo je „on“ nebo „tento produkt“. Opakovat podmět vypadá neelegantně, ale v jiném kontextu zachrání smysl.

Ne: „Montuje se do 14 dnů.“ Ano: „Sprchový kout 80 × 80 cm montujeme do 14 dnů.“

Odpověď na začátek sekce

První věta pod nadpisem má odpovědět na otázku, kterou nadpis klade. Podrobnosti a výjimky až potom.

Nadpis, který řekne, o čem sekce je

Nadpis „Montáž a doprava“ nese informaci. Nadpis „Proč my?“ nenese žádnou.

Bez odkazů typu „jak jsme uvedli výše“

Klíčovou podmínku nebo číslo raději zopakujte. Systém, který pracuje s jedním úsekem, „výše“ nevidí.

Fakta v textu, ne v obrázku

Rozměry, ceny a podmínky v HTML textu nebo tabulce. Údaje schované v obrázku nebo v PDF se do textu stránky nedostanou.

Více podtémat na stránce je v pořádku

Stránka o koupelnových koutech může řešit rozměry, montáž i údržbu. Rozdělit ji kvůli AI na tři stránky není potřeba, když jsou sekce jasně oddělené.

Nejčastější chyby z našich auditů

Rozsekání

Z jednoho průvodce dvacet mini stránek

Každá stránka má pár odstavců, žádná nepokryje téma a všechny si navzájem konkurují. Google pasáže najde i v jedné dlouhé stránce.

Kontext

Sekce, která bez předchozí nedává smysl

„Druhá varianta je levnější“ — ale jaká první? Vytržená pasáž neodpoví na nic.

Počítání

Sekce zkracované na předepsaný počet slov

Text ořezaný na „ideálních 60 slov“ podle tabulky z blogu. Žádný doložený limit neexistuje a z odpovědi vypadnou podstatné podmínky.

Mix

Pět témat v jednom odstavci

Cena, doprava, záruka a reklamace v jednom bloku textu. Ani čtenář, ani systém nepozná, kde začíná odpověď na jeho otázku.

Data

Parametry jen v obrázku nebo v PDF

Technický list naskenovaný jako obrázek. Text stránky pak neobsahuje nic, co by šlo vybrat jako odpověď.

Nadpisy

Nadpisy bez obsahu

„Úvod“, „Další informace“, „Závěr“. Neříkají, o čem sekce je, a nepomáhají nikomu, kdo hledá konkrétní odpověď.

Časté dotazy

Indexuje Google jednotlivé pasáže zvlášť?

Ne. Google indexuje a hodnotí celé stránky. Passage ranking mu pomáhá rozpoznat jednotlivé sekce a lépe posoudit, jak je stránka relevantní pro konkrétní dotaz. Starší označení „passage indexing“ bylo zavádějící.

Mám kvůli AI rozdělit dlouhé články na víc stránek?

Kvůli AI ne. Google uvádí, že dokáže pochopit více témat na jedné stránce a ukázat relevantní část. Dělit článek má smysl tehdy, když jednotlivé části odpovídají na úplně jiné potřeby čtenářů — ne proto, aby byly kratší.

Jak dlouhá má být jedna sekce?

Tak dlouhá, aby odpověděla na otázku z nadpisu včetně podmínek, které k odpovědi patří. Doložený ideální počet slov neexistuje. Rozumné je dát hlavní odpověď do první věty nebo dvou a podrobnosti až za ni.

Řídí se dělení textu mými nadpisy?

Nemusí. Veřejně popsané nástroje dělí text podle počtu tokenů s překryvem, ne podle nadpisů. Jak to dělají velké AI vyhledávače, není zveřejněné. Proto je bezpečnější, když smysl nese i samotný text sekce, ne jen nadpis nad ní.

Pomůže sekce s častými dotazy?

Dotaz s krátkou samostatnou odpovědí je přirozeně dobře vytržitelná pasáž, takže to dává smysl. Funguje to ale jen u skutečných otázek zákazníků s konkrétní odpovědí. Automaticky vygenerované otázky s obecnými odpověďmi nepomohou nikomu.

✂️

Chcete vědět, které vaše texty AI neumí použít?

Projdeme klíčové stránky a ukážeme sekce, které bez kontextu nedávají smysl, a místa, kde fakta chybí v textu. Navrhneme úpravy, ne přepis celého webu. Bez závazku.

Termín si vyberete v kalendáři.

Michal Binka, SEO PRAKTICKY

Autor článku

Michal Binka

Zakladatel SEO PRAKTICKY s.r.o.

Chunking je dobrý příklad toho, jak se technický pojem z vývoje AI mění v prodejní argument pro zbytečnou práci. Užitečné jádro je jednoduché: každá sekce má dávat smysl sama o sobě.

Přes 20 let se věnuje SEO pro české e-shopy, je autorem tří knih o SEO a Zlatým Shoptet Partnerem. Přednáší na oborových konferencích a vede tým specialistů v Brně.

  • Zlatý Shoptet Partner
  • Certifikovaný specialista Collabim
  • Autor tří knih o SEO

Zdroje

Způsob, jakým AI vyhledávače dělí a vybírají pasáže, jejich provozovatelé nezveřejňují. Výchozí hodnoty nástrojů pro RAG se mění s jejich verzemi — u konkrétních údajů si ověřte aktuální stav.