Proč většina původních dat nikdy není citována?

Proč většina původních dat nikdy není citována?
Primární výzkum je vzácný, ale od AI získává 3,3× více citací na stránku. Zjistěte, proč benchmarkové studie překonávají jiná původní data.

První část průzkumu se zabývala důležitými signály citací z třetích stran, zatímco druhá část vysvětlila, proč se vyplatí publikovat vlastní data: jsou totiž nejsilnějším samostatným prediktorem originality stránky, a překážka pro získání viditelnosti či autority touto cestou je poměrně nízká.

Toto vydání přináší další argumenty pro využívání vlastních dat při tvorbě obsahu.

Publikovat čísla je nutné. Ne vždy jsou to ale právě čísla, která získají citaci. V rámci průzkumu byla analyzována data o citacích z Gauge, aby bylo zjištěno, co AI skutečně oceňuje při publikování vlastních dat. Odpověď je užší a užitečnější než prosté tvrzení „původní data vítězí“. 

AI zvýhodňuje jeden formát téměř na úkor všech ostatních, a to benchmark, který odpovídá na otázku „co je nejlepší“.

Vlastní výzkum je vzácný, ale jeho dopad je nadprůměrný

Vycházeno bylo ze souboru URL citovaných v Gauge: 301 aktivních stránek, na které systémy AI odkazovaly (316 unikátních promptů napříč 7 obory) a které dohromady získaly 1 075 citací.

Po kompletním auditu URL se ukázalo, že pouze 8 z těchto 301 stránek splňovalo definici primárního výzkumu. To znamená, že samotný zdroj dat i metodika byly přímo na stránce, místo aby šlo o zpracování čísel někoho jiného.

Osm stránek z 301 představuje 2,7 % celého souboru. Těchto stejných 8 stránek ale získalo 90 z 1 075 citací, tedy 8,4 % všech citací. Vlastní výzkum se objevuje jen zřídka, ale když už se objeví, jeho podíl na citacích je 3× vyšší, než by odpovídalo jeho zastoupení.

Ještě názornější pak je podívat se na hustotu citací. Primární výzkum měl v průměru 11,3 citace na stránku. Všechny ostatní stránky pak měly v průměru 3,4 citace. Stránka s primárním výzkumem tak získávala citace 3,3× častěji než stránka bez vlastního výzkumu.

Primární výzkum tedy přináší kumulativní efekt v podobě dalších citací.

Je to podobný vzorec jako u zjištění o informačním přínosu, jen se na něj nyní díváme z pohledu AI namísto klasických deseti modrých odkazů ve vyhledávání.

Tam vlastní data souvisela ze všech sledovaných charakteristik nejvíce s originalitou stránky. Zde vlastní data souvisejí s hustotou citací. Obě zjištění ukazují stejným směrem: číslo, které můžete vytvořit pouze vy, je velmi silnou pákou.

Původní výzkum vítězí, když otázka vyžaduje benchmark

Tady se tvrzení „původní data vítězí“ začíná zpřesňovat. 90 citací primárního výzkumu nebylo mezi 8 stránkami rozděleno rovnoměrně. Stejně tak nebyly rovnoměrně rozděleny mezi jednotlivá témata.

75 z 90 citací pocházelo z jediné skupiny: benchmarků cloudových datových skladů. Samotný benchmark datových skladů od Fivetranu získal 44 citací, tedy téměř polovinu všech citací primárního výzkumu v celém souboru.

Realita je tedy taková, že pokud skupinu benchmarků vynecháme, vlastní výzkum se v souboru citací téměř neprojevuje.

Úspěchem tedy není „publikovali jsme vlastní data“. Úspěchem je „publikovali jsme benchmark, který odpovídá na otázku při porovnávání produktů před nákupem“ a něco takového vytváří jen velmi málo firem.

Pozn.: Benchmark zde znamená, že je změřeno několik konkrétně pojmenovaných věcí vůči sobě podle určitého kritéria a výsledky jsou pak zveřejněny v podobě čísel.

Vlastní výzkum je nejúčinnější tehdy, když je prezentován způsobem, který přímo odpovídá na komerční dotazy typu „která varianta je nejlepší?“

Právě o to Googlu jde u obsahu, který není zaměnitelný s ostatními: prioritou je přinášet nové a užitečné informace, ke kterým je obtížné se jinak dostat.

Citace primárního výzkumu se soustředily tam, kde prompt požadoval porovnání možností na základě měřitelných parametrů: rychlosti, ceny, latence, výnosu nebo výkonu.

To vysvětluje výrazný nárůst citací u benchmarků datových skladů. Označení „HR Tech / Compensation“ je poněkud nepřesné, ale citace v této kategorii pocházely převážně z promptů zaměřených na benchmarky cloudových datových skladů. Fivetran, Estuary a ClickHouse nabízely konkrétní čísla, která mohla AI využít.

Stejný vzorec se v menším měřítku objevuje také u kryptoměn / Solany. Marinade a Helius získaly citace, protože otázky týkající se stakingu a MEV vyžadují data přímo z daného ekosystému, nikoli obecné vysvětlující články.

Tento vzorec mizí u témat, kde neexistuje jasný benchmark. V kategoriích B2B SaaS / CRM, Education / TEFL a Product Analytics se objevovaly seznamy, produktové stránky, vysvětlující články a případové studie. Po očištění dat žádné z těchto témat neobsahovalo citovanou stránku s primárním výzkumem.

Podrobnější pohled na obsah, který získal 44 citací

Benchmark datových skladů od Fivetranu získal sám o sobě 44 citací z tohoto datového souboru. Dvě benchmarkové stránky Fivetranu dohromady získaly 58 z 90 citací primárního výzkumu. Proč?

Jde o obsah z roku 2022, ale při bližším pohledu je snadné pochopit, proč mu LLM dávají přednost.

Přímo odpovídá na měřitelné srovnání

Porovnává konkrétní datové sklady: BigQuery, Redshift, Snowflake a Databricks, a to podle rychlosti a ceny. Obsahuje velké množství konkrétních entit a nebojí se jmenovat všechny hlavní hráče. 

Staví na skutečných datech z vlastního zdroje

Fivetran testoval skutečné používání zákazníky, nikoli pouze syntetické předpoklady, a tuto volbu přímo vysvětluje. 

Podrobně ukazuje metodiku

Jde o důležitý signál důvěryhodnosti. Samostatné části vysvětlují, jaká data byla dotazována, jaké dotazy byly použity a jak byl každý datový sklad nastaven a optimalizován. Čtenář i model tak mohou přesně vidět, jak čísla vznikla. 

Struktura je vytvořena tak, aby z ní bylo možné snadno čerpat

Popisné nadpisy jako „Výsledky“, „O kolik se výkon zlepšil?“ nebo „Proč se naše výsledky liší od předchozích benchmarků?“ umožňují AI přiřadit konkrétní otázku k pasáži, která na ni odpovídá. 

Odkazuje na zdrojová data a další zdroje

Stránka uvádí zdroje v poznámkách, včetně studie C-Store, a odkazuje na podkladová data. Každé tvrzení je tak možné ověřit. Jen málo značek věnuje datově podloženému obsahu tolik práce a ještě méně z nich zpřístupňuje celý dataset kvůli transparentnosti. 

Přiznává vlastní omezení

Opravy z prosince 2022, pojmenovaná metodologická omezení a upřímné upozornění na „výkonnostní minimum“ zvyšují důvěryhodnost kvantitativních tvrzení, místo aby ji snižovaly. Autoři zároveň uvádějí provedené opravy. 

URL se nikdy nezměnila

Stránka z roku 2022 stále získává citace i v roce 2026, protože zůstala na stejné kanonické adrese. 

Data, která stojí za stránkou tohoto typu, je dnes snazší získat a analyzovat než kdykoli dříve. Obtížnější je ale vše, co následuje, tedy čistá metodika, propojené zdroje, opravy, přehledná struktura a ochota přiznat, co čísla nedokazují. Právě v tom spočívá skutečná práce a konkurenční výhoda.

Tento obsah založený na vlastních datech není ledabyle napsanou tiskovou zprávou s napůl zpracovanými čísly. Tento obsah totiž vyžadoval nemalé množství práce a autoritu si udržuje už čtyři roky.

Závěr je jednoduchý: AI automaticky neodměňuje „vlastní data“. Odměňuje vlastní výzkum tehdy, když stránka poskytuje jasnou odpověď na měřitelné srovnání, které dokládá hlubokou odbornost a důvěryhodnost.

Příležitostí je vytvořit veřejně dostupný dataset pro otázku, kterou kupující řeší, ale pro kterou AI v současnosti nemá kvalitní benchmarkový zdroj. To navazuje na zjištění o nezodpovězených otázkách: příležitost existuje a v těchto oborech jí zatím nikdo nevyužil prostřednictvím skutečného datasetu.

Vlastní data potřebují balíček připravený k citování

Vlastní data dávají stránce něco, co AI nemůže získat z dalšího vysvětlujícího článku. AI je ale stále musí najít, interpretovat a propojit s konkrétní otázkou.

Právě zde mnoho značek o citaci přichází. Publikují vlastní čísla, ale ukryjí je v textu, zpřístupní je až po vyplnění formuláře, přesunou URL nebo neuvedou metodiku. Data existují. Citace nikoli.

Stránky, které v tomto datovém souboru uspěly, měly obojí: původní čísla i strukturu vhodnou pro citování. Stabilní URL, jasnou metodiku, konkrétní srovnání a výsledky, které přímo odpovídaly na otázku potenciálního zákazníka.

Kdo vítězí? 

Jednoznačně vítězí značky, které mají vlastní data o produktech, jejich používání nebo cenách a dokážou je zpracovat do srovnání, podle kterého se může zákazník rozhodnout, a které zároveň může LLM využít při tvorbě doporučení. 

Kdo prohrává?

Značky, které publikují vlastní čísla ukrytá v textu, na pomalých nebo nestabilních stránkách a bez rámce srovnání, ze kterého by AI mohla čerpat. 

Stránka s výzkumem připraveným k citování má čtyři části:

Začněte výsledkem srovnání

Hlavní zjištění („X je nejrychlejší, Y je při velkém objemu nejlevnější“) by mělo být v první třetině stránky. Nejdříve výsledek, potom metodika a nakonec nuance. 

Jasně popište metodiku

Uveďte vzorek, časové období, co bylo měřeno a jak. Důvěryhodnost připisovaná konkrétnímu číslu je součástí toho, co z něj dělá citovatelný údaj. Metodiku proto vysvětlete přímo na stránce. 

Pokud jde o srovnání, explicitně ho jako srovnání označte

AI sahá po benchmarcích k otázkám typu „co je nejlepší“. Tabulka, která porovnává konkrétně pojmenované možnosti podle konkrétních parametrů, je formát, ze kterého může snadno čerpat. 

Udržujte stabilní URL

Jedna kanonická stránka, která zůstane aktivní a nebude při každém redesignu přesunuta nebo přejmenována. Citace, kterou získáte toto čtvrtletí, může přinášet další citace i příští čtvrtletí pouze tehdy, pokud stránka stále existuje. Z 365 citovaných URL v tomto datovém souboru jich bylo 64 nefunkčních, přesměrovaných nebo jinak rozbitých. Společně tak přišly o 203 citací. 

To je práce, která stojí za benchmarkem vhodným k citování, a je jí více, než se na první pohled zdá.

HockeyStack popsal vlastní přístup v playbooku o publikování výzkumných reportů: publikovali 18 původních reportů založených výhradně na anonymizovaných datech od vlastních zákazníků, tedy na datech, která žádný konkurent nemohl jednoduše zopakovat.

Jejich proces popisuje všechny kroky, které můžeme vidět také na stránce Fivetranu, a to nejprve určit potřebné datové body, nechat kolegu získat data pomocí SQL, definovat a zdokumentovat metodiku tak, aby čísla obstála při kontrole, a následně postavit celý report kolem skutečné otázky cílového zákazníka. Metodiku označují za nezbytnou z dobrého důvodu: bez ní bude někdo vaše data vždy zpochybňovat.

V době analýzy pomocí AI jsou samotná data tou snadnější částí. Obtížnější je vytvořit z nich obsah, který lze citovat, dodržuje E-E-A-T a dokáže si udržet viditelnost u komerčních dotazů i čtyři roky po zveřejnění.

FAQ

Proč AI cituje vlastní výzkum častěji než běžný obsah?

Vlastní výzkum přináší unikátní data, která AI nemůže jednoduše získat z jiných článků. Stránky s primárním výzkumem proto získávají v průměru 3,3× více citací.

Jaký typ vlastních dat má největší potenciál pro citace AI?

Nejlépe fungují benchmarky, které přímo porovnávají konkrétní produkty nebo služby podle měřitelných parametrů, například ceny, rychlosti nebo výkonu.

Co musí obsahovat výzkum, aby ho AI mohla snadno citovat?

Kromě unikátních dat by měl mít jasně popsanou metodiku, přehlednou strukturu, konkrétní výsledky a stabilní URL. Důležité je také uvést zdroje a umožnit ověření dat.

Proč nestačí vlastní data pouze zveřejnit?

AI musí data nejen najít, ale také pochopit a propojit s konkrétní otázkou. Pokud jsou čísla ukryta v textu nebo za formulářem a chybí metodika či kontext, jejich potenciál výrazně klesá.

Zdroj: searchengineland.com, searchenginejournal.com, marketingland.com, facebook.com, cpcstrategy.com

Autor: Vlastimil Malík

Foto zdroj: AI, pixabay.com

Autor článku:
Vlastimil Malík

SEO manažer

Vlastimil patří mezi zkušené SEO specialisty s více než dvacetiletou praxí v online marketingu. Optimalizaci pro vyhledávače se věnuje již od roku 2001, kdy bylo SEO teprve na začátku svého vývoje. Díky dlouholetým zkušenostem pomohl stovkám firem zvýšit návštěvnost webů, zlepšit pozice ve vyhledávačích a získat více zákazníků z organického vyhledávání. Specializuje se na komplexní SEO strategie, obsahový marketing, copywriting, tvorbu PR článků i optimalizaci webů pro moderní AI vyhledávače a asistenty. Má bohaté zkušenosti s tvorbou obsahu pro e-shopy, magazíny, firemní weby i rozsáhlé obsahové portály. Dokáže připravit odborné i prodejní texty na téměř jakékoli téma – od módy, stavebnictví a gastronomie až po automobilový průmysl nebo technické obory. Při své práci propojuje technické SEO, kvalitní obsah a marketingovou strategii tak, aby texty přinášely nejen lepší pozice ve vyhledávačích, ale především skutečné obchodní výsledky.

Více článků z blogu

Používáme tyto nástroje

WordPress
PrestaShop
WooCommerce
Shoptet
Upgates
FastCentrik
GA4
Google Merchant
Google Tag Manager
Collabim
Marketing Miner
ahrefs
Ecomail
Mailchimp