Databáze promptů · AI · 11 promptů
Prompty z návodu
Analýza dat obyčejnou řečí: trvalý skill nad DuckDB
11 promptů z tohoto návodu. Doplňte to, co je v [hranatých závorkách] — vlastní kontext, text dokumentu nebo jméno nástroje. Právě ten kontext dělá rozdíl mezi obecnou a použitelnou odpovědí.
Jak taková tichá chyba vypadá v praxi
datum;kategorie;castka 2026-01-05;Nájem;-12500,00 2026-01-07;Potraviny;-842,50 2026-01-09;Potraviny;-1230,00 2026-02-01;Mzda;48000,00
Nastavení: jeden prompt, který to celé založí
Nainstaluj mi DuckDB CLI (jen pokud ho ještě nemám; je zdarma, návod na duckdb.org) a vytvoř trvalý, opakovaně použitelný skill, kterým budu nad libovolným datovým souborem dělat analýzy tak, že ti obyčejnou řečí řeknu, co chci. Skill ať dodržuje tohle: - Počítá se přes DuckDB CLI (příkaz duckdb), který čte CSV, Excel, Parquet, JSON i gzip přímo ze souboru, bez zakládání databáze. SQL syntaxi ber z dokumentace: duckdb.org/docs/current/sql/introduction. - Než napíšeš dotaz, prohlédni si soubor: schéma a statistiky přes SUMMARIZE FROM 'soubor', prvních pár řádků přes FROM 'soubor' LIMIT 5. Nehádej názvy ani typy sloupců, a když je cokoli nejasného, zeptej se uživatele. - U každé odpovědi ukaž SQL dotaz, kterým výsledek vznikl, a počet řádků, které do něj vstoupily. - Data neupravuj a nepřepisuj. Když je potřeba něco vyřadit nebo opravit, udělej to v dotazu a napiš, co a proč jsi vyřadil. - Skill ulož tak, aby se načítal sám, kdykoli budu mluvit o analýze datového souboru — nemusím ho vyvolávat ručně. Až to bude hotové, ukaž mi, kam jsi skill uložil a co v něm stojí.
1. První seznámení s neznámým souborem
Budeme analyzovat soubor [název souboru]. Zatím nic nepočítej. Prohlédni si ho a napiš mi: 1. Kolik má řádků a sloupců. 2. U každého sloupce: jak se jmenuje, jaký typ se načetl, kolik má prázdných hodnot a kolik různých hodnot obsahuje. 3. Které sloupce se podle tebe načetly ve špatném typu (typicky číslo nebo datum přečtené jako text) a jak by se to opravilo. 4. Co je v těchto datech jedno pozorování — co znamená jeden řádek. 5. Na co se mě potřebuješ zeptat, než začneme počítat. Nešetři: radši se zeptej na pět věcí, než abys jednu odhadl.
2. Přehled po obdobích s kategoriemi a skupinou Ostatní
Budeme analyzovat soubor [název souboru]. Udělej mi přehled po [měsících] podle opakovaných kategorií. To, co se pravidelně neopakuje, zařaď do skupiny Ostatní. Za opakovanou považuj kategorii, která se objeví aspoň [ve třech obdobích] a tvoří aspoň [1 %] celku. Výstup: tabulka období krát kategorie, v buňkách [součet částky] a v závorce počet záznamů, plus součty za kategorii i za období. Pod přehledem vypiš všechny anomálie porušující typické vzorce: - kategorie, která se objevila poprvé nebo naopak zmizela, - hodnota odchýlená od obvyklé úrovně dané kategorie o víc než [dvojnásobek], - období, ve kterém chybí kategorie, jež jinak bývá vždy. U každé anomálie napiš, o který konkrétní řádek jde. Nevysvětluj příčiny, jen ukaž, co je nezvyklé.
3. Porovnání dvou období
Porovnej v souboru [název] období [A] proti období [B]. Chci tabulku: [kategorie], hodnota v období A, hodnota v období B, absolutní rozdíl, procentní změna a PŘÍSPĚVEK k celkové změně v procentních bodech. Seřaď podle příspěvku, největší nahoře. Pak zvlášť rozlož celkovou změnu na dvě složky: změnu počtu záznamů a změnu průměrné hodnoty záznamu. Nakonec vypiš kategorie, které jsou jen v jednom z období. Období definuj podle sloupce [datum] a napiš mi, kolik dní každé z nich obsahuje — když se liší, upozorni na to.
4. Duplicity a nekonzistence
V souboru [název] chci najít nepořádek. Nic neopravuj, jen vypiš. 1. Úplné duplicity: řádky shodné ve všech sloupcích, s třemi příklady. 2. Duplicity podle klíče [sloupec nebo kombinace sloupců]: záznamy se stejným klíčem, ale odlišné v ostatních sloupcích. 3. Textové hodnoty, které jsou nejspíš totéž psané jinak: liší se jen velikostí písmen, mezerami na konci, diakritikou nebo překlepem. Ukaž je ve dvojicích s četností obou variant. 4. Hodnoty mimo očekávaný rozsah: záporná čísla tam, kde nedávají smysl, data v budoucnosti, nulové částky. 5. Sloupce, kde chybí víc než [5 %] hodnot. U každého bodu napiš počet zasažených řádků a podíl z celku.
5. Segmentace: kdo nebo co tvoří většinu
V souboru [název] mě zajímá rozložení podle [sloupec, např. zákazník / produkt / pobočka]. 1. Seřaď segmenty podle [součtu hodnoty] a ukaž top 20: segment, hodnota, podíl na celku, kumulativní podíl. 2. Napiš, kolik segmentů dělá 50 % a kolik 80 % celku. 3. U každého segmentu z top 20 přidej počet záznamů a MEDIÁN hodnoty záznamu, ne průměr. 4. Zvlášť ukaž segmenty s jediným záznamem — kolik jich je a jaký podíl celku tvoří dohromady. Přidej řádek „zbytek" se souhrnem ostatních segmentů, ať tabulka sedí na celek.
6. Spojení dvou souborů přes společný klíč
Mám dva soubory: [soubor A] a [soubor B]. Chci je propojit přes [společný sloupec]. Nejdřív mi bez počítání napiš: - kolik unikátních hodnot klíče je v každém souboru, - kolik hodnot z A nemá protějšek v B a naopak — u obou ukaž pět příkladů, - jestli je vztah 1:1, nebo se některý klíč v jednom ze souborů opakuje (a kolikrát nejvíc). Teprve pak je spoj tak, aby se ze souboru A neztratil ani jeden řádek, a doplň z B sloupce [výčet]. Po spojení mi napiš, kolik má výsledek řádků, a porovnej to s počtem řádků v A. Když se čísla liší, vysvětli proč.
7. Kontrola úplnosti dat
V souboru [název] chci ověřit, jestli jsou data úplná. 1. Nejstarší a nejnovější [datum] v souboru. 2. Časovou řadu počtu záznamů po [dnech / týdnech / měsících] — vypiš ji celou, ať vidím díry. 3. Období, ve kterých není ani jeden záznam, i když sousední období záznamy mají. Vypiš je jako konkrétní rozsahy. 4. Období, kde je počet záznamů výrazně nižší nebo vyšší než obvykle (odchylka od mediánu o víc než [50 %]). 5. Jestli se v čase mění složení dat: kategorie objevující se jen v části období, nebo sloupec, který je od určitého data prázdný. Napiš i to, kdy přesně ke změně došlo.
Nechte si vypsat dotaz, který to spočítal
Ukaž mi dotaz, kterým vzniklo číslo [konkrétní hodnota], a rozeber mi ho po částech běžnou češtinou — u každé části napiš, jaké rozhodnutí o mých datech v sobě skrývá. Pak zvlášť vypiš: - které řádky dotaz vyřadil a kolik jich bylo, - co se stane s řádky, kde je [sloupec] prázdný, - kde by dotaz mohl vrátit špatné číslo, aniž by spadl. Nakonec napiš jednu alternativu: jak by šlo totéž spočítat jinak a proč by výsledek mohl vyjít jinak.
Kolik řádků vypadlo a proč
U poslední analýzy mi udělej bilanci řádků: - kolik řádků měl zdrojový soubor, - kolik jich postupně ubylo v každém kroku a z jakého důvodu, - kolik jich vstoupilo do finálního výsledku, - kontrola: sedí součet vyřazených a započítaných na celek? U každého kroku, který vyřadil víc než [2 %] řádků, ukaž pět konkrétních vyřazených řádků, ať vidím, o co jsem přišel. Pokud nějaké řádky vypadly nechtěně, napiš to natvrdo místo toho, abys to vysvětloval.