
S rychlým rozvojem umělé inteligence se otevřela možnost provádět s její pomocí datovou analýzu. Nemyslí se tím pomoc s generováním kódu pro analýzu dat, typicky v jazyce R nebo Python, ale přímá analýza dat pomocí otázek a příkazů. Cílem tohoto článku je ukázat zkušenosti s analýzou a upozornit na problémy s tím spojené.
Stručný závěr je, že analyzovat data pouze s pomocí AI je možné, ale je nutné mít znalost používaných metod i určité zkušenosti s analýzou dat. Výsledky je třeba důkladně kontrolovat a opakovaně je dalšími dotazy upřesňovat, případně rozporovat. Uživatel musí stále vědět, na co se ptát. Zcela se spoléhat na odpovědi je spojeno s velkým rizikem omylů. Zásadní chyba je nechat se od AI vést, uživatel musí celý proces neustále řídit a usměrňovat.
Předmětem analýzy byl soubor, pro hledání závislosti číselné proměnné na kategorizovaných proměnných, analýza mohla sahat od t-testu pro srovnání skupin až po komplexní lineární hierarchický model. Vyzkoušená analýza se držela spíše jednoduššího přístupu. Soubor konkrétně popisuje účinnost diety, zaznamenána je hmotnost před, v průběhu a po skončení diety. Případy jsou popsány základními demografickými charakteristikami, přítomností onemocnění a jsou rozděleny do tří skupin podle typu diety. Soubor v tomto tvaru je obvykle výsledkem mnoha datových úprav, kontrol, a transformací. V reálné praxi by AI analýza mohla následovat až po provedení nemalého objemu prací, konkrétní náročnost přípravy dat se ale liší případ od případu.
Pro analýzu byl použit model Gemini 3.5 Flash-Lite v bezplatné verzi. Otázky byly kladeny co nejjednodušeji, pokud možno bez používání statistických termínů. Cílem bylo simulovat práci běžného uživatele s pouze minimální znalostí statistiky. V článku jsou uvedeny klíčové otázky, respektive příkazy, zkrácené odpovědi AI a komentář k jejich správnosti.
Na začátku analýzy byl do promptu pomocí znaku plus nahrán soubor ve formátu xlsx.
Příkaz: Zobraz prvních 20 řádků.
Odpověď: Na obrazovce se objevily správné řádky.
Kontrola dat je zásadní AI může soubor špatně načíst nebo dokonce použije jiná data.
Otázka: Jaká je vhodná analýza souboru, co je v něm zajímavého?
Odpověď:
Doporučený postup je správný, začíná se popisem dat a pak následují očekávatelné analýzy. V praxi by se měla provést i kontrola dat. AI by ji pravděpodobně dokázala provést, ale uživatel by ji musel požadovat a vědět, že je nutná. Zjištění jsou zde uvedena zkráceně, detailně je reprodukován vliv diety B. Ve zjištěních se AI omezila jen na bod 1 b) ostatní je uvedeno jen okrajově. Uživatel se musí sám zaměřit na to, co ho zajímá. AI sama neuvádí žádné statistické zdůvodnění závěrů, uživatel se opět na to musí ptát a nesmí se spokojit s pouhým konstatováním rozdílů. Červeně zvýrazněná věta je zavádějící, data neumožňují udělat si závěr o dlouhodobém efektu diety, zde se AI dopustila malé halucinace.
Příkaz: Proveď analýzu vlivu demografických faktorů a typu onemocnění.
Odpověď: Jsem jen jazykový model, takže vám s tím nemůžu pomoct.
Odmítnutí spolupráce se čas od času objeví, snad je to vlastností bezplatné verze, obvykle se stačí zeptat znovu a trochu jinak.
Otázka: Jaký je vliv demografických faktorů?
Odpověď:
Pohlaví respondenta
Průměrný celkový úbytek: Ženy zhubly v průměru o 6,97 kg, zatímco muži o 6,57 kg.
Zjištění: Rozdíl mezi pohlavími v celkovém průměru není velký. Ženy vykazují o něco vyšší průměrný pokles, zejména kvůli specifickým skupinám (např. u diety B, kde ženy dosáhly výraznějších výsledků).
Uveden je zde jen vliv pohlaví, ostatní odpovědi jsou analogické. Není přesně uvedeno, že úbytek hmotnosti představuje rozdíl mezi hmotností na konci a na začátku diety. Tuto skutečnost si uživatel musí domyslet, případně si ji musí nechat od AI upřesnit.
Uživatel v této fázi potřebuje mít znalost o nutnosti statistického vyhodnocení dat, musí vědět, že prostý popis rozdílů je nedostačující. Je třeba posoudit společné působení vlastností pacienta a otestovat jeho statistickou významnost. AI na to neupozorní. Následuje zásadní otázka, konkrétně formulovaná, která nasměruje analýzu správným směrem.
Otázka: Jaký je komplexní model demografických údajů, onemocnění a typu diety na úbytek hmotnosti?
Odpověď:
Pro zjištění komplexního vlivu demografických údajů, typu onemocnění a typu diety na celkový úbytek hmotnosti slouží vícenásobná lineární regrese (metoda OLS). Tento model umožňuje vyhodnotit čistý vliv každého faktoru při současném kontrolování ostatních proměnných.
Výsledky komplexního regresního modelu
Výsledná rovnice:
Úbytek hmotnosti = 4,98 + 0,43.žena + 1,29⋅“věk 46“ – 60 + 0,18⋅“věk 61“ + 0,37⋅“věk <30 – 0,25⋅vysokoškolské – 0,49⋅základní -1,05⋅onemocnění + 5,49⋅dieta B + 0,51⋅dieta C
Vysvětlení parametrů modelu:
Nyní je uvedena celá odpověď, protože zde se nachází klíčový moment celé analýzy. Uživatel musí mít alespoň základní znalost statistických modelů, aby se v odpovědi dokázal orientovat. V odpovědi se objevují odborné pojmy, jako R2, variabilita, statistická významnost a hodnota p, ty je třeba znát nebo se je nově naučit.
Zobrazení modelu není standardní, koeficienty se běžně uvádějí v tabulce spolu s jejich statistickými vlastnostmi, to opět musí uživatel vědět a žádat. Ve výstupu chybí i tabulka s celkovou významností efektů (věk, dieta), okomentovány jsou jen některé dílčí významnosti vůči referenční skupině. Referenční skupina je navíc zvolena podle abecedy, což je v případě ordinálních (uspořádaných) odpovědí nevhodné.
V odpovědi není uvedeno, co by se mělo zkontrolovat, nebo zda je model již hotový. Zejména chybí návrh na vyloučení nevýznamných efektů z modelu, což je postup, který by měl přímo následovat. Na další otázku, zda je model v pořádku, se AI zaměřila na heteroskedasticitu, tedy nekonstantní rozptyl residuí. Při řešení heteroskedasticity se konečně objevil náznak, že by bylo vhodné model odhadnout bez nevýznamných efektů. Tento náznak bylo třeba rozvinout dalšími dotazy, než se podařilo vytvořit zjednodušený model.
Nový chat se zcela stejnými otázkami vedl sice ke stejným numerickým hodnotám, ale model byl ukázán a okomentován odlišně a byly zdůrazněny odlišné aspekty modelu. Konkrétní podoba odpovědí je do jisté míry náhodná, což je očekávatelná vlastnost jazykových modelů. I tato skutečnost však ukazuje, že uživatel musí být schopen průběh analýzy aktivně řídit a průběžně kontrolovat její výsledky.
Závěrem lze uvedený pokus o analýzu i další provedené pokusy shrnout konstatováním, že AI je při analýze užitečným pomocníkem, ale rozhodně analýzu neprovede za uživatele a nemůže jej v tomto procesu nahradit. Její odpovědi sice byly v těchto příkladech numericky správné, ale byly neúplné a podle očekávaní do jisté míry náhodné. AI neposkytuje ucelený pohled na analýzu, ale předkládá spíše jednotlivé střípky informací, z nichž musí celkový obraz sestavit sám uživatel.
Termín: 22. 9. 2026
Formát: online přes MS Teams