Databáze promptů · AI · 14 promptů
Prompty z návodu
Analýza dat s AI: od CSV k závěru, který obhájíte
14 promptů z tohoto návodu. Doplňte to, co je v [hranatých závorkách] — vlastní kontext, text dokumentu nebo jméno nástroje. Právě ten kontext dělá rozdíl mezi obecnou a použitelnou odpovědí.
Jak vypadá použitelný export
Tady je hlavička mého exportu a prvních 20 řádků (oddělovač středník, kódování UTF-8, desetinná čárka): [vlož 20 řádků včetně názvů sloupců] Nedělej zatím žádné výpočty. Udělej datový audit: 1. U každého sloupce urči typ (text, číslo, datum, kategorie) a co podle názvu a hodnot pravděpodobně znamená. 2. Označ problematické sloupce: smíšené formáty, datum jako text, čísla s jednotkou v buňce, kategorie psané různě („Praha“, „praha“, „PRAHA “). 3. Vypiš, na co se mě musíš zeptat, než začnu počítat — typicky jestli jsou ceny s DPH a jestli se mají storna vyřadit. 4. Napiš, co je v těchto datech jedno pozorování. Nic nedomýšlej — kde nemáš z ukázky jistotu, napiš to jako otázku pro mě.
Anonymizace: co se nikdy nenahrává
Napiš Python skript, který připraví anonymizovanou kopii mého CSV. Struktura sloupců: [vlož jen názvy sloupců, bez dat] Skript má: 1. odstranit sloupce [jméno, e-mail, telefon, adresa], 2. [zakaznik_id] nahradit pořadovým číslem a převodní tabulku uložit do klic.csv, který zůstane u mě, 3. v textovém sloupci [poznámka] jen OZNAČIT řádky s e-mailem, telefonem nebo možným jménem a vypsat je ke kontrole, 4. uložit data_anonym.csv se stejným oddělovačem a kódováním a vypsat, kolik řádků a sloupců zůstalo.
Kdy chat počítat smí: nástroje, které kód opravdu spouštějí
Pracujeme nad mým datovým souborem. Pro celou konverzaci platí: 1. Žádné číslo neuvádíš z hlavy ani z odhadu — každou hodnotu spočítej kódem a ukaž mi kód i jeho výstup. 2. Když na výpočet nemáš data nebo nástroj, napiš „tohle nespočítám“ místo přibližné odpovědi. 3. U každého výsledku uveď, z kolika řádků vznikl a kolik jich bylo vyřazeno a proč. 4. Při nejednoznačnosti (chybějící hodnoty, duplicity, podezřelé kategorie) se zeptej, nerozhoduj sám. 5. Na konci každé odpovědi napiš větou, co by mohlo výsledek zkreslit.
Prompt, který vyrobí analytický skript
Tady je hlavička mého CSV (prvních 5 řádků, oddělovač středník, kódování UTF-8, desetinná čárka): [vlož 5 řádků včetně názvů sloupců] Napiš Python skript (pandas, matplotlib), který: 1. načte soubor jako data/objednavky.csv a ošetří české kódování i desetinnou čárku, 2. vyčistí data: vyřadí řádky se stavem [storno, nezaplaceno], sjednotí psaní kategorií, převede [datum] na datový typ, 3. vypíše, kolik řádků načetl, kolik vyřadil a z jakého důvodu, 4. spočítá tržby, počet objednávek a průměrnou objednávku po měsících a totéž v rozpadu podle [kategorie] a [zdroj], 5. uloží čísla do results.csv a grafy do složky grafy/ jako PNG. Požadavky: - ke každému kroku český komentář, PROČ se dělá, - skript musí projít i s prázdnými buňkami, - žádná natvrdo zapsaná čísla, vše počítej z dat, - na konci vypiš kontrolní součet: tržby za celé období.
Jak vypadá výstup, kterému se dá věřit
Načteno 14 203 řádků, 18 sloupců. Vyřazeno 612 storen a 87 nezaplacených, zbývá 13 504. Chybějící hodnoty: kategorie 41 řádků (ponechány jako „neuvedeno“). Rozpad června podle kategorie (proti květnu): kategorie kveten cerven zmena Kuchyne 612 400 598 200 -2,3 % Uklid 418 700 401 500 -4,1 % Zahrada 510 100 203 400 -60,1 % Ostatni 320 200 249 800 -22,0 % Kontrolní součet za období: 21 480 300 Kč Výsledky uloženy: results.csv, grafy/trzby-mesice.png
Rozumět skriptu, i když ho neumíte napsat
Vysvětli mi tenhle skript po blocích, jako člověku, který programovat neumí a nechce se to učit. U každého bloku napiš: - co se v něm děje běžnou češtinou, - jaké rozhodnutí o mých datech v sobě skrývá (co vyřazuje, co doplňuje, co zaokrouhluje), - co by se stalo, kdybych ho vynechal. Pak zvlášť vypiš místa, kde skript může tiše vrátit špatné číslo, aniž by spadl (chybějící hodnoty, duplicity, dělení nulou, špatně načtený datum), a 5 otázek, které mi k téhle analýze může položit šéf nebo klient, i s odpověďmi. [vlož skript]
Profil dat jako povinný první krok
Napiš Python skript, který udělá profil datasetu — chci vědět, s čím pracuju, než začnu počítat. Ať vypíše: 1. počet řádků a sloupců, 2. u každého sloupce: typ, podíl chybějících hodnot, počet unikátních hodnot, 3. u číselných: minimum, maximum, průměr, medián, 1. a 99. percentil, 4. u textových: 10 nejčastějších hodnot s četností a upozornění na podezřele podobné dvojice (stejné až na mezery a velikost písmen), 5. u datových: nejstarší a nejnovější datum a chybějící období (dny nebo měsíce bez jediného záznamu), 6. počet duplicit celkem i podle [klíčový sloupec], 7. řádky s nesmyslnými hodnotami: záporné ceny, věk mimo rozsah 0-120, datum v budoucnosti. Výstup ať je čitelný v terminálu, nic neopravuj — jen ohlas.
Co se z těch dat vlastně dá zjistit
Tady je profil mého datasetu (výstup profilovacího skriptu): [vlož výstup] Kontext: data pocházejí z [zdroj], používám je k [účel] a mlhavě mě zajímá [např. proč klesly tržby v červnu]. Nepočítej nic. Navrhni 12 měřitelných otázek, které JDOU z těchto sloupců zodpovědět. U každé napiš: - otázku jednou větou, - které sloupce a jaký výpočet na ni odpoví, - jaký výsledek by znamenal „ano“ a jaký „ne“, - k jakému rozhodnutí by mi odpověď byla dobrá. Pak vypiš 5 otázek, které by se nabízely, ale tahle data na ně nestačí, a u každé napiš, co konkrétně by mi k odpovědi chybělo. Nakonec označ tři otázky, kterými bych měl začít, a zdůvodni to.
Trend, sezonnost a šum
Napiš Python skript pro analýzu časové řady z mých dat. Sloupce: [datum], [hodnota], volitelně [segment]. Skript má: 1. agregovat hodnotu po dnech, týdnech a měsících, 2. dopočítat klouzavý průměr přes 7 a 30 dní, 3. spočítat meziroční srovnání (stejný měsíc loni) v procentech, 4. normalizovat měsíční hodnoty na počet pracovních dní a ukázat, jak moc se tím obraz změní, 5. vypsat tabulku dní, kdy se hodnota liší od klouzavého průměru o víc než 2 směrodatné odchylky, 6. vykreslit graf: denní hodnoty světle, klouzavý průměr silně, odchylky zvýrazněné. Do komentářů napiš, jaké předpoklady metoda má a kdy by mě mohla splést (krátká řada, chybějící dny, změna metodiky sběru).
Když najdete anomálii, rozpadněte ji
V datech mám tenhle nález: [např. tržby v červnu -22 % proti květnu]. Chci zjistit, čím je způsobený. Napiš skript, který propad rozloží na příspěvky segmentů: 1. rozpad podle [kategorie], [region], [zdroj], [nový vs. vracející se zákazník] — u každé dimenze tabulka: období A, období B, absolutní i procentní změna a PŘÍSPĚVEK k celkové změně v procentních bodech, seřazeno podle příspěvku, 2. rozklad na počet objednávek versus průměrnou hodnotu objednávky — chci vědět, jestli ubylo nákupů, nebo se zmenšily, 3. denní časová řada pro tři nejvíc zasažené segmenty, ať vidím, jestli propad začal skokem, nebo postupně. Nevymýšlej vysvětlení, vrať jen čísla a graf.
Volba typu grafu
Uprav grafickou část mého skriptu, aby grafy měly jednotný střízlivý styl vhodný do firemní prezentace: - bezpatkové písmo, popisky nejméně 11 bodů, - popisky os česky včetně jednotek („Tržby (tis. Kč)“), - nadpis grafu je věta se závěrem, ne název proměnné („Propad je jen v kategorii Zahrada“, ne „Tržby dle kategorie“), - tisícové oddělovače, osa y u sloupcových grafů od nuly, - maximálně 4 barvy, zbytek odstíny šedé, čitelné i černobíle, - bez mřížky, bez rámečku, bez 3D, - do popisku doplň n (počet záznamů) a období, - export do grafy/ jako PNG, 300 dpi, bílé pozadí. Nastavení dej na jedno místo na začátku skriptu.
Interaktivní graf jako artefakt
Vytvoř mi artefakt — interaktivní přehled mých dat. Vstupní data vkládám jako JSON (už agregovaná, bez osobních údajů, [počet] řádků): [vlož agregovaná data] Přehled má obsahovat: - přepínač období (posledních 12 měsíců / letos / vše), - filtr podle [kategorie] s možností vybrat víc položek, - nahoře čtyři souhrnná čísla: tržby, počet objednávek, průměrná objednávka, meziroční změna, - čárový graf vývoje v čase, který reaguje na filtry, - vodorovný sloupcový graf top 10 [produktů] s hodnotami, - tabulku, kterou jde seřadit kliknutím na hlavičku. Styl: střízlivý, čitelný na projektoru, česky včetně formátu čísel. Když je po filtrování méně než 5 záznamů, napiš to místo grafu.
Šest způsobů, jak se splést nad správnými čísly
Tady jsou výsledky mojí analýzy (výstup skriptu a popis grafů): [vlož výstup] Kontext: data jsou [zdroj, období, co obsahují a co neobsahují]. Předběžný závěr, ke kterému se kloním: [závěr]. Nepiš text prezentace. Odpověz ve třech blocích: 1) Co data doslova říkají — jen tvrzení, která z čísel plynou, u každého uveď, ze kterého čísla vychází. 2) Alternativní vysvětlení mého závěru: zmatečná třetí proměnná, obrácená příčina, výběrové zkreslení, sezonnost, změna metodiky, malý vzorek. 3) Co z těchhle dat NEMŮŽU tvrdit, i když by to znělo dobře — hlavně záměna souvislosti za příčinu a zobecnění mimo vzorek. Na konec napiš, jaké jedno další měření by můj závěr nejvíc potvrdilo nebo vyvrátilo.
Od čísla k doporučení
Mám hotovou analýzu s těmito výsledky: [vlož závěry a klíčová čísla] Připrav podklad na 15minutové vystoupení pro [vedení / klienta / tým]. Struktura: 1. Jedna věta, která shrnuje zjištění (bez čísel). 2. Tři čísla, která ji podpírají — každé s obdobím a základnou. 3. Co z toho plyne: 2-3 varianty postupu, u každé odhad dopadu a co je na ní riskantní. 4. Tři nejpravděpodobnější námitky publika a odpověď na ně. 5. Co zatím nevíme a co bychom museli změřit. Používej výhradně čísla z mého vstupu, nic nedopočítávej. Žádná superlativa. Kde ti podklad chybí, napiš TODO.