Co v článku najdete
- Získat data nebylo úplně snadné
- Čtyři skryté "trubky", kterými ChatGPT nasává web
- Některé dotazy se na web vůbec nedostanou
- Jeden dotaz odpálí lavinu desítek poddotazů
- Staženo neznamená citováno a citováno neznamená zmíněno
- Co z toho plyne pro praktické AI SEO (GEO)?
- Skvělý obsah viditelnost v AI nezaručí
- Často kladené otázky (FAQ)
Většina doporučení ohledně optimalizace pro AI vyhledávače (GEO) pořád dokola říká, abyste tvořili kvalitní obsah, dělali přehledové články a byli aktivní v diskuzích na oborových fórech a sociálních sítích. Suganthan Mohanadasan, SEO výzkumník a spoluzakladatel agentury Snippet Digital, se ale rozhodl zjistit skutečný stav věcí a rozebral chování ChatGPT přímo v síťovém provozu. Co z jeho analýzy vypadlo?
Získat data nebylo úplně snadné
Suganthan dva dny detailně sledoval a analyzoval reálný síťový provoz (network traffic v čitelném JSON), který ChatGPT posílá do prohlížeče na pozadí generovaných odpovědí. Zatímco obří studie spotřebují tisíce promptů a vyhodnocují až finální odpověď jako "černou skříňku", jeho přístup na to šel přesně z opačné strany. Nesledoval, jak často se co stává v populaci, ale dokumentoval samotné součástky stroje a jejich přesné interní názvy.
- „Jde o data jednoho člověka, jednoho přihlášeného Pro účtu a pár dní provozu, ne o celoplošnou studii. Zachytil jsem cca 1 240 záznamů o zdrojích napříč několika desítkami vyhledávání. Strukturální zjištění, interní pole a jejich chování jsou neprůstřelná, protože pole stačí vidět jednou, abyste věděli, že existuje. Čísla a procenta berte střízlivě jako směr, ne jako přesné měření,“ upozorňuje autor studie.
Technická odbočka: Proč nestačí zachytávat síťové pakety?
Výzkumník původně zkoušel zachytávat provoz klasicky přes nástroje typu Wireshark, ale narazil na tvrdou realitu. Samotné zprávy jsou šifrované pomocí TLS a aplikace ChatGPT navíc komunikuje přes protokol QUIC (HTTP/3). Wireshark v handshake uvidí maximálně tak serverové jméno openai, ale samotný obsah konverzace zůstane nečitelný.
Dvě cesty, které v praxi selhaly:
- Automatizovaný Chrome: Cloudflare vás při pokusu o automatizované řízení prohlížeče okamžitě zablokuje na nekonečné smyčce ověřování, jestli jste člověk.
- Zachytávání na běžícím spojení: Odpovědi z ChatGPT streamují přes dlouhotrvající připojení otevřené už při načtení stránky, takže skripty vložené uprostřed relace je vůbec nevidí.
Reálná data, dotazy i veškerá metadata v JSON tak Suganthan získal až přímo z Network panelu v DevTools svého běžného prohlížeče po dešifrování.
Čtyři skryté "trubky", kterými ChatGPT nasává web
Při zkoumání síťových dat objevil Suganthan interní pole result_source, které systém připojuje ke každému staženému výsledku z webu. Výsledky označené tímto štítkem přicházejí ze tří hlavních kanálů, pro které OpenAI využívá i komerční scrapingové služby (Bright Data, Oxylabs).
- Labrador: Licencovaný kanál pro vybrané, vysoce autoritativní vydavatele s dohodou s OpenAI (například Reuters, The Guardian, Financial Times, Wikipedia nebo TechRadar). Úryvky obsahu z těchto zdrojů dosahují délky až 1 080 znaků (fakticky jde o plné texty).
- Bright / Oxylabs: Komerční scrapingové nástroje a infrastruktura. Pro ChatGPT představují hlavní pracovní nástroj na stahování dat o nákupech, financích, počasí, lokálních zprávách i komerčních dotazech.
- Serp: Běžný otevřený webový index, objevující se hlavně u zpravodajských agregátorů.
Při testování dotazů na počasí odhalil expert přesnou dělbu práce: globalizované servery jako Met Office nebo AccuWeather stahoval kanál Bright, zatímco lokální deníky obsluhoval Oxylabs.
- „Většina z nás soutěží v kategorii scrapovaného obsahu, nikoliv v licencovaném kanálu. Licencovaný patrový systém je běžným firmám uzavřený. Pokud se chcete dostat do výsledků, musíte být pro crawlery snadno čitelní. Data a fakta servírujte v čistém HTML textu, nikdy je neschovávejte za skripty, do PDF nebo obrázků. Vašimi hlavními pákovými efekty jsou promyšlené digitální PR, zmínky o značce a oborová fóra,“ říká Suganthan Mohanadasan.
Některé dotazy se na web vůbec nedostanou
Než ChatGPT začne jakkoliv vyhledávat, roztřídí si uživatelský dotaz do jedné ze šesti kategorií v poli turn_use_case:
- Instant search (rychlé hledání).
- Shopping (nákupní dotazy).
- Text (čistě textové zpracování bez webu).
- Local (lokální vyhledávání).
- Thinking (pokročilé uvažování a prohledávání).
- Image generation (generování obrázků).
Jestliže systém vyhodnotí dotaz jako text, na web vůbec nesáhne. Běžné dotazy jako jak vyměnit kolo u auta, napiš funkci v Pythonu pro sloučení dvou polí nebo přelož toto do 4 jazyků odbavil ChatGPT výhradně ze svých trénovacích dat s nulovým síťovým provozem.
Suganthan však narazil na zásadní zádrhel: I aktuální a odborný dotaz na nejnovější doporučení pro léčbu diabetu 2. typu (kde byste čekali důraz na E-E-A-T a čerstvá data) bral systém jako text a odpovídal čistě z paměti modelů, bez jediného vyhledávání. Z deseti záměrně aktuálních dotazů takto bez vyhledávání skončily hned tři.
O zařazení do kategorie rozhoduje přesná formulace dotazu, nikoliv jeho samotné téma:
- Nejlepší káva v okolí zapne Local.
- Nejlepší 4K televize v prodeji zapne Shopping.
- Nejlepší 4K televize recenze zůstane jako běžné hledání.
- „Než utratíte peníze za tvorbu stránky, ověřte si, zda se na daný typ dotazu vůbec vyhledává. Pokud jde o definici nebo návod generovaný přímo z tréninkových dat, žádná webová stránka se do odpovědi nemá šanci dostat, ať je jakkoliv skvělá. Pomůže vám jedině dlouhodobé budování autority a čekání, až vás vezmou do příštího trénovacího datasetu,“ vysvětluje Suganthan Mohanadasan.
Jeden dotaz odpálí lavinu desítek poddotazů
Při použití pokročilejších uvažovacích modelů (Thinking) neprobíhá vyhledávání jednorázově. U rychlého modelu vyběhne jeden přeformulovaný dotaz a je hotovo. Jakmile ale Suganthan zadal uvažovacímu modelu srovnání několika AI nástrojů, systém na pozadí rozjel 15 až 40 samostatných poddotazů.
Systém se chová až neuvěřitelně detailně:
- Posílá cílené dotazy typu site:peec.ai/pricing přímo na ceníkové stránky firem.
- Pokud cenu nenajde hned, zkusí si ji vnitřně "tipnout" a vzápětí spustí vyhledávání, aby si ověřil, zda tato čísla na oficiálním webu opravdu sedí.
- V průběhu rešerše sám objevuje další konkurenční značky a začne na internetu pátrat i po jejich cenách.
- Na stažených stránkách vyhledává konkrétní řetězce a pomocí interních příkazů prohlížeče (open a click) si sám otevírá a rozklikává prvky na serveru.
Staženo neznamená citováno a citováno neznamená zmíněno
Výzkumník upozorňuje na zásadní rozdíl mezi tím, co algoritmus při rešerši navštíví, a tím, co nakonec uživateli ukáže jako odkaz.
- Propast mezi stažením a citací: ChatGPT projde obrovské množství stránek, ale většina z nich poslouží jen jako tichý podklad a ve finální odpovědi se jako odkaz vůbec neobjeví.
- Případ YouTube: Během testování byl obsah z YouTube stažen 201× jako datový podklad, ale ani jednou z toho nevznikla přímá citace s odkazem. Je to dáno tím, že jde o metadata k videu, ze kterých model čerpá kontext, ale nepředává je jako textový zdroj.
- Dominance Redditu: Reddit se ukázal jako vůbec nejcitovanější doména v testovaném vzorku, protože obsahuje přímé textové odpovědi, zkušenosti a diskuze, které LLM snadno přemění na citace.
- Rozdíl mezi citací a zmínkou: Studie odhalila i třetí stav. Systém vašemu brandu sice nevypíše přímý odkaz pod větu jako citaci zdroje, ale uvede vás v textu odpovídající kachličkou (chipem). I to je pro budování povědomí značky v AI velká výhra.
Co z toho plyne pro praktické AI SEO (GEO)?
Suganthanův experiment posouvá optimalizaci pro AI z oblasti dohadů do roviny architektury systému.
- Čistá technická struktura: Scrapery jako Bright Data a Oxylabs potřebují číst čistý HTML kód. Důležitá fakta, ceny a parametry nesmí být schované v JavaScriptu ani v obrázcích.
- Budování značky mimo vlastní web: Posilujte svou přítomnost na místech, kam scrapery chodí nejčastěji. Vedle globálního Redditu myslete v Česku také na lokální platformy (eMimino, Webtrh), oborová fóra, specializované poradny, diskuze na Heurece a PR články na velkých zpravodajských portálech. Nezapomeňte prověřit, jestli nemáte v textovém souboru robots.txt zablokované vyhledávací boty OpenAI (OAI-SearchBot a ChatGPT-User) a jestli se váš web správně indexuje v Bingu, ze kterého ChatGPT v živém vyhledávání čerpá.
- Optimalizace ceníkových stránek: AI modely jdou agresivně po cenách. Ceníky by měly být veřejně přístupné, čitelné pro roboty a neměly by vyžadovat vyplňování kontaktů.
Skvělý obsah viditelnost v AI nezaručí
To největší úskalí optimalizace pro AI vyhledávače spočívá v tom, že většina oboru dodnes staví svoje strategie jen na pouhém dohadování a slepém sledování výstupů. Suganthanův pohled přímo do síťového provozu ale jasně ukázal, že ChatGPT není žádná neproniknutelná záhada. Pod povrchem běží velmi přesně nastavené mechaniky, které striktně rozhodují o tom, jestli systém váš web vůbec navštíví, jestli data stáhne přes komerční scrapery jako Bright Data či Oxylabs, a jestli je nakonec promění v reálnou citaci s odkazem.
Pro vaši marketingovou praxi z toho plyne celkem jednoznačný úkol: Přestaňte spoléhat na to, že vám vysokou viditelnost v AI automaticky zajistí jen líbivý text na blogu. Pokud váš web nemá perfektní technický základ a servíruje klíčová data schovaná v JavaScriptu nebo v obrázcích, robotické scrapery je jednoduše přehlédnou. Stejně tak nemá smysl pálit rozpočet na témata a návody, které ChatGPT odbaví čistě ze své paměti bez jediného sáhnutí na web.
Dlouhodobě úspěšná GEO strategie tak stojí na spojení technické čitelnosti a silného brandu napříč celým internetem. Budujte autoritu své značky tam, kde z ní AI modely čerpají nejčastěji, tedy v nezávislých recenzích, na odborných portálech, v PR článcích a na diskusních fórech. Jedině tak zajistíte, že až se systém vydá na vyhledávací rešerši, vaše značka bude přesně tím zdrojem, o který se bude chtít opřít.
Často kladené otázky (FAQ)
Jak ChatGPT rozhoduje o tom, jestli při odpovídání použije živé vyhledávání na webu?
Systém ještě před spuštěním vyhledávání roztřídí uživatelský dotaz do jedné ze šesti interních kategorií podle jeho přesné formulace, nikoli jen podle samotného tématu. Pokud dotaz vyhodnotí jako běžný textový či obecný dotaz, odpoví čistě ze své paměti a trénovacích dat bez jediného sáhnutí na web. Na živý internet se vydá až ve chvíli, kdy formulace aktivuje specifický režim, jako je například nákupní, lokální nebo hloubkové vyhledávání.
Jaký je rozdíl mezi tím, když ChatGPT webovou stránku stáhne a když ji reálně cituje?
Mezi stažením obsahu a jeho finálním zobrazením uživateli je obrovská propast. ChatGPT běžně prohledá a stáhne desítky stránek jako tichý podklad pro kontext (například metadata z YouTube), ale jako přímý odkaz v odpovídající kachličce nebo citaci uvede jen zlomky z nich. Nejčastěji cituje zdroje s přímými textovými odpovídajícími pasážemi a zkušenostmi, jako je třeba Reddit nebo české diskuzní platformy.
Co je potřeba na webu upravit, aby se produkty a služby dostaly do odpovědí ChatGPT?
Základem je perfektní technická čitelnost v čistém HTML kódu, protože scrapingové nástroje jako Bright Data nebo Oxylabs nedokážou číst data schovaná v JavaScriptu, obrázcích či PDF souborech. Klíčové informace a ceníky udržujte veřejně přístupné bez nutnosti vyplňovat kontakty a ujistěte se, že nemáte v robots.txt zablokované vyhledávací boty OpenAI (OAI-SearchBot a ChatGPT-User). Vedle techniky pak budujte silný brand na externích místech, odkud AI čerpá nejčastěji, tedy na oborových fórech, srovnávačích a zpravodajských portálech.
Zdroj: searchengineland.com, searchenginejournal.com, marketingland.com, facebook.com, cpcstrategy.com
Autor: Martin Kulhánek
Foto zdroj: AI, pixabay.com