Popis online kurzu Testování generativní AI
Postavit prototyp s jazykovým modelem dnes zvládne každý za jedno odpoledne. Ale jak zjistíte, jestli vaše aplikace odpoví správně i na tisící otázku, kterou jste jí sami nikdy nepoložili? Jestli nová verze promptu kvalitu skutečně zlepšila, nebo ji jen změnila? A jestli váš chatbot neprozradí system prompt prvnímu zvědavému uživateli – nebo nepošle firemní data na cizí adresu jen proto, že si přečetl otrávený dokument? Klasické testování softwaru na tyto otázky nestačí: jazykové modely jsou nedeterministické, „poslouchají“ instrukce ukryté v datech a mýlí se přesvědčivě.
Tento kurz je praktický testovací žebřík. Začneme úplně dole – ručním zkoušením modelu v chatu s testovacím deníkem v ruce – a vyšplháme se až k automatizovaným red-teamingovým útokům na agenta, který jedná vaším jménem. Cestou si v Pythonu napíšete první pytest testy pro výstupy LLM, otestujete agenta s nástroji, postavíte LLM soudce, který za vás hodnotí kvalitu odpovědí, sestavíte evaluační pipeline s čísly namísto pocitu a nakonec si na pěti modelech (Claude, GPT, Gemini, DeepSeek, Mistral) naživo vyzkoušíte, jak se útočí – a jak se bránit.
Kurz je určený vývojářům, kteří už s LLM něco postavili (nebo se na to chystají) a potřebují jistotu před nasazením; QA inženýrům a testerům, kteří chtějí své řemeslo rozšířit o specifika jazykových modelů; a bezpečnostním specialistům, které zajímá prompt injection v praxi, ne v teorii. Hodí se také techničtěji zaměřeným produktovým manažerům – kapitoly 1 a 5 jsou zcela bez kódu. A pokud vás čeká soulad s EU AI Act, článek 15 (přesnost, robustnost, kybernetická bezpečnost) vyžaduje přesně to, co se zde naučíte měřit.
Co se v kurzu Testování generativní AI naučíte
Kurz má pět kapitol, které na sebe navazují jako příčky žebříku – od testů bez jediného řádku kódu až po útoky na agenty.
1. Ruční testování: proč je testování LLM jiný sport
Bez kódu, jen vy, chat a testovací deník. Naučíte se, co vlastně u jazykového modelu testujeme a jak si ruční testování zorganizovat tak, aby po něm něco zůstalo.
- Faktická přesnost a halucinace: jak je vyvolat a zachytit
- Konzistence a citlivost na formulaci promptu
- Zaujatost a férovost odpovědí
- Testovací deník – a kde ruční testování končí
2. Automatizované testy v Pythonu (notebooky 01 a 02)
Od chatu ke kódu. První automatizovaný test výstupu LLM v pytestu a od něj k celé testovací sadě – včetně testování agenta, který volá nástroje.
- Test toho, co model nesmí říct, parametrizované testy, HTML reporty
- Strukturované výstupy s Pydanticem a invarianty: když odpověď vyvrátí sama sebe
- Testování agentů (Google ADK): co agent skutečně zavolal – správný nástroj, správné parametry, správné pořadí
- Hraniční případy a diagnostika: chyba promptu, nebo chyba testu?
3. LLM jako soudce a evaluační pipeline (notebooky 03 a 04)
Některé kvality nelze ověřit porovnáním řetězců – tón, úplnost, etiku. Tehdy potřebujete soudce. Naučíte se ho postavit tak, abyste mu mohli věřit.
- Kdy LLM soudce potřebujete a kdy ho raději nepoužívat
- Pydantic model, judge funkce a poctivé ošetření chyb
- Vícerozměrné hodnocení, prahy kvality a etický soudce pro bankovnictví
- Evaluační pipeline: změříte, zda změna promptu nebo modelu agenta skutečně přinesla zlepšení
4. Bezpečnostní testování a red teaming (notebooky 05 a 06)
Nejoblíbenější část kurzu. Zaútočíte na vlastní aplikaci dříve, než to udělá někdo jiný – a potom ji posílíte.
- Přímé a nepřímé útoky na system prompt: roleplay, „zopakuj vše výše“, speciální tokeny
- Který model odolá? Porovnání robustnosti pěti modelů a hardening system promptu
- Nepřímá injekce v RAG pipeline a otrávená data – útočník s modelem nikdy nemluví přímo
- Obejití LLM guardrailu a jeho hardening; injekce do agenta, který jedná: exfiltrace dat
5. Bonus: můj výzkum
Čtyři vlastní publikace jako živé ukázky toho, jak testování vypadá, když se dělá „naostro“ – mluvím o nich volně, bez kódu.
- Bloom: behaviorální bezpečnostní evaluace modelu s frameworkem od Anthropicu
- GeoBias: geopolitická zaujatost malých jazykových modelů
- Warden: LLM soudce jako obrana proti veřejným jailbreakům
- SelfJudge: dokážou malé modely posuzovat samy sebe?
Co si z kurzu Testování generativní AI odnesete
- Sestavíte testovací sadu pro LLM aplikaci v pytestu – včetně negativních testů („toto model nesmí říct“) a invariantů.
- Postavíte LLM soudce se strukturovaným výstupem a budete vědět, kdy mu věřit a kdy ne.
- Změříte, zda změna promptu nebo modelu kvalitu skutečně zlepšila – evaluační pipeline s čísly namísto pocitu.
- Otestujete vlastní aplikaci proti prompt injection, útokům přes RAG, obcházení guardrailů i injekci do agentů – a budete vědět, jak ji posílit.
- Šest hotových Jupyter notebooků, které si přizpůsobíte vlastnímu projektu.
Vstupní požadavky na kurz
- Základy Pythonu (funkce, slovníky, spuštění Jupyter notebooku). Kapitoly 1 a 5 jsou bez kódu a zvládne je každý.
- Zkušenost s jazykovými modely alespoň na uživatelské úrovni; výhodou je absolvovaný kurz Generativní AI v Pythonu.
- Účet na OpenAI a OpenRouter – celý kurz vás vyjde přibližně na jeden dolar API kreditu. Materiály jsou připravené pro Google Colab, lokálně nemusíte nic instalovat.
Co všechno s kurzem Testování generativní AI získáte
- videotutoriály na téma Testování generativní AI,
- šest praktických Jupyter notebooků a slajdy – záměrně v angličtině, s terminologií, se kterou se setkáte v dokumentaci; průběžně aktualizované na Google Drivu a GitHubu,
- certifikát o absolvování online kurzu Testování generativní AI,
- moderované diskusní fórum, ve kterém na otázky odpovídá autor kurzu
- garance vrácení peněz do 14 dnů v případě nespokojenosti s kurzem.