Testování a bezpečnost generativní AI

3h 49min
Čas
35
Kapitol
Umělá inteligence (AI)
Kategorie
-
Hodnocení
Začátečník
Level
slovenský
Jazyk kurzu

Popis online kurzu Testování generativní AI

Postavit prototyp s jazykovým modelem dnes zvládne každý za jedno odpoledne. Ale jak zjistíte, jestli vaše aplikace odpoví správně i na tisící otázku, kterou jste jí sami nikdy nepoložili? Jestli nová verze promptu kvalitu skutečně zlepšila, nebo ji jen změnila? A jestli váš chatbot neprozradí system prompt prvnímu zvědavému uživateli – nebo nepošle firemní data na cizí adresu jen proto, že si přečetl otrávený dokument? Klasické testování softwaru na tyto otázky nestačí: jazykové modely jsou nedeterministické, „poslouchají“ instrukce ukryté v datech a mýlí se přesvědčivě.

Tento kurz je praktický testovací žebřík. Začneme úplně dole – ručním zkoušením modelu v chatu s testovacím deníkem v ruce – a vyšplháme se až k automatizovaným red-teamingovým útokům na agenta, který jedná vaším jménem. Cestou si v Pythonu napíšete první pytest testy pro výstupy LLM, otestujete agenta s nástroji, postavíte LLM soudce, který za vás hodnotí kvalitu odpovědí, sestavíte evaluační pipeline s čísly namísto pocitu a nakonec si na pěti modelech (Claude, GPT, Gemini, DeepSeek, Mistral) naživo vyzkoušíte, jak se útočí – a jak se bránit.

Kurz je určený vývojářům, kteří už s LLM něco postavili (nebo se na to chystají) a potřebují jistotu před nasazením; QA inženýrům a testerům, kteří chtějí své řemeslo rozšířit o specifika jazykových modelů; a bezpečnostním specialistům, které zajímá prompt injection v praxi, ne v teorii. Hodí se také techničtěji zaměřeným produktovým manažerům – kapitoly 1 a 5 jsou zcela bez kódu. A pokud vás čeká soulad s EU AI Act, článek 15 (přesnost, robustnost, kybernetická bezpečnost) vyžaduje přesně to, co se zde naučíte měřit.

Co se v kurzu Testování generativní AI naučíte


Kurz má pět kapitol, které na sebe navazují jako příčky žebříku – od testů bez jediného řádku kódu až po útoky na agenty.

1. Ruční testování: proč je testování LLM jiný sport


Bez kódu, jen vy, chat a testovací deník. Naučíte se, co vlastně u jazykového modelu testujeme a jak si ruční testování zorganizovat tak, aby po něm něco zůstalo.
  • Faktická přesnost a halucinace: jak je vyvolat a zachytit
  • Konzistence a citlivost na formulaci promptu
  • Zaujatost a férovost odpovědí
  • Testovací deník – a kde ruční testování končí

2. Automatizované testy v Pythonu (notebooky 01 a 02)


Od chatu ke kódu. První automatizovaný test výstupu LLM v pytestu a od něj k celé testovací sadě – včetně testování agenta, který volá nástroje.
  • Test toho, co model nesmí říct, parametrizované testy, HTML reporty
  • Strukturované výstupy s Pydanticem a invarianty: když odpověď vyvrátí sama sebe
  • Testování agentů (Google ADK): co agent skutečně zavolal – správný nástroj, správné parametry, správné pořadí
  • Hraniční případy a diagnostika: chyba promptu, nebo chyba testu?

3. LLM jako soudce a evaluační pipeline (notebooky 03 a 04)


Některé kvality nelze ověřit porovnáním řetězců – tón, úplnost, etiku. Tehdy potřebujete soudce. Naučíte se ho postavit tak, abyste mu mohli věřit.
  • Kdy LLM soudce potřebujete a kdy ho raději nepoužívat
  • Pydantic model, judge funkce a poctivé ošetření chyb
  • Vícerozměrné hodnocení, prahy kvality a etický soudce pro bankovnictví
  • Evaluační pipeline: změříte, zda změna promptu nebo modelu agenta skutečně přinesla zlepšení

4. Bezpečnostní testování a red teaming (notebooky 05 a 06)


Nejoblíbenější část kurzu. Zaútočíte na vlastní aplikaci dříve, než to udělá někdo jiný – a potom ji posílíte.
  • Přímé a nepřímé útoky na system prompt: roleplay, „zopakuj vše výše“, speciální tokeny
  • Který model odolá? Porovnání robustnosti pěti modelů a hardening system promptu
  • Nepřímá injekce v RAG pipeline a otrávená data – útočník s modelem nikdy nemluví přímo
  • Obejití LLM guardrailu a jeho hardening; injekce do agenta, který jedná: exfiltrace dat

5. Bonus: můj výzkum


Čtyři vlastní publikace jako živé ukázky toho, jak testování vypadá, když se dělá „naostro“ – mluvím o nich volně, bez kódu.
  • Bloom: behaviorální bezpečnostní evaluace modelu s frameworkem od Anthropicu
  • GeoBias: geopolitická zaujatost malých jazykových modelů
  • Warden: LLM soudce jako obrana proti veřejným jailbreakům
  • SelfJudge: dokážou malé modely posuzovat samy sebe?

Co si z kurzu Testování generativní AI odnesete

  • Sestavíte testovací sadu pro LLM aplikaci v pytestu – včetně negativních testů („toto model nesmí říct“) a invariantů.
  • Postavíte LLM soudce se strukturovaným výstupem a budete vědět, kdy mu věřit a kdy ne.
  • Změříte, zda změna promptu nebo modelu kvalitu skutečně zlepšila – evaluační pipeline s čísly namísto pocitu.
  • Otestujete vlastní aplikaci proti prompt injection, útokům přes RAG, obcházení guardrailů i injekci do agentů – a budete vědět, jak ji posílit.
  • Šest hotových Jupyter notebooků, které si přizpůsobíte vlastnímu projektu.

Vstupní požadavky na kurz

  • Základy Pythonu (funkce, slovníky, spuštění Jupyter notebooku). Kapitoly 1 a 5 jsou bez kódu a zvládne je každý.
  • Zkušenost s jazykovými modely alespoň na uživatelské úrovni; výhodou je absolvovaný kurz Generativní AI v Pythonu.
  • Účet na OpenAI a OpenRouter – celý kurz vás vyjde přibližně na jeden dolar API kreditu. Materiály jsou připravené pro Google Colab, lokálně nemusíte nic instalovat.

Co všechno s kurzem Testování generativní AI získáte

  • videotutoriály na téma Testování generativní AI,
  • šest praktických Jupyter notebooků a slajdy – záměrně v angličtině, s terminologií, se kterou se setkáte v dokumentaci; průběžně aktualizované na Google Drivu a GitHubu,
  • certifikát o absolvování online kurzu Testování generativní AI,
  • moderované diskusní fórum, ve kterém na otázky odpovídá autor kurzu
  • garance vrácení peněz do 14 dnů v případě nespokojenosti s kurzem.

Seznam kapitol

Úvod do kurzu
Vitajte v kurze
Dostupné pouze po zakoupení přístupu
Materiály a prostredie kurzu
Dostupné pouze po zakoupení přístupu
Úvod do testovania LLM
Prečo je testovanie LLM iný šport
Dostupné pouze po zakoupení přístupu
Faktická presnosť a halucinácie
Dostupné pouze po zakoupení přístupu
Konzistencia a citlivosť na prompt
Dostupné pouze po zakoupení přístupu
Zaujatosť a férovosť
Dostupné pouze po zakoupení přístupu
Testovací denník a kde manuálne testovanie končí
Dostupné pouze po zakoupení přístupu
Manuálne a automatizované testovanie bez LLM
Od chatu ku kódu: prvý automatizovaný test
Dostupné pouze po zakoupení přístupu
Test toho, čo model nesmie povedať
Dostupné pouze po zakoupení přístupu
Testovacia sada v pyteste
Dostupné pouze po zakoupení přístupu
Parametrizované testy
Dostupné pouze po zakoupení přístupu
HTML reporty z pytest
Dostupné pouze po zakoupení přístupu
Testovanie agentov: v čom je to iné
Dostupné pouze po zakoupení přístupu
Pomocná funkcia: čo agent naozaj zavolal
Dostupné pouze po zakoupení přístupu
Správny nástroj, správne parametre, správne poradie
Dostupné pouze po zakoupení přístupu
Hraničné prípady
Dostupné pouze po zakoupení přístupu
LLM ako sudca a evaluačná pipeline
Kedy potrebujete LLM sudcu
Dostupné pouze po zakoupení přístupu
Prvý sudca: Pydantic model, judge funkcia a ošetrenie chýb
Dostupné pouze po zakoupení přístupu
Viacrozmerné hodnotenie a prahy kvality
Dostupné pouze po zakoupení přístupu
Etický sudca pre bankovníctvo
Dostupné pouze po zakoupení přístupu
Cvičenie, zásady a kedy sudcu nepoužiť
Dostupné pouze po zakoupení přístupu
Evaluačná pipeline: prehliadka notebooku 04
Dostupné pouze po zakoupení přístupu
Bezpečnostné testovanie LLM
Prečo testovať bezpečnosť a na čo budeme útočiť
Dostupné pouze po zakoupení přístupu
Priame útoky na system prompt
Dostupné pouze po zakoupení přístupu
Nepriame techniky: roleplay a spol.
Dostupné pouze po zakoupení přístupu
Ktorý model odolá? Porovnanie robustnosti
Dostupné pouze po zakoupení přístupu
Obrana: hardening system promptu
Dostupné pouze po zakoupení přístupu
Nepriama injekcia v RAG pipeline
Dostupné pouze po zakoupení přístupu
Otrávené dáta: zákazník podvádza systém
Dostupné pouze po zakoupení přístupu
Obídenie LLM guardrailu a jeho hardening
Dostupné pouze po zakoupení přístupu
Injekcia do agenta, ktorý koná: exfiltrácia dát
Dostupné pouze po zakoupení přístupu
Môj výskum (bonus)
O čom je táto kapitola?
Dostupné pouze po zakoupení přístupu
Bloom: behaviorálna bezpečnostná evaluácia
Dostupné pouze po zakoupení přístupu
GeoBias: geopolitická zaujatosť malých modelov
Dostupné pouze po zakoupení přístupu
SelfJudge: dokážu malé modely súdiť samy seba?
Dostupné pouze po zakoupení přístupu

Podívej se i na tyto kurzy

16 Online kurzů