LLM-Anwendungen testen und absichern
Qualität, Robustheit und Sicherheit generativer KI-Systeme systematisch prüfen
01 Intro
02 Trainingsprogramm
Inhalte
LLM-Anwendungen als Testobjekt
- probabilistisches Verhalten und mehrere valide Antworten
- Modell, Prompt, Kontext und Anwendungslogik
- Retrieval, Tools und Agenten als Teile des Gesamtsystems
- fachliche Richtigkeit, Relevanz und Vollständigkeit
- Robustheit, Sicherheit und Nachvollziehbarkeit
- Latenz, Kosten und Verfügbarkeit als Qualitätsmerkmale
Anforderungen und Testorakel
- Qualitätsziele in prüfbare Eigenschaften übersetzen
- Muss-Kriterien, Toleranzen und unerlaubte Eigenschaften
- Referenzantworten und fachliche Referenzen
- Eigenschaften statt exakter String-Vergleiche
- mehrere korrekte oder teilweise korrekte Antworten bewerten
- deterministische, semantische und menschliche Orakel kombinieren
Evaluationsdatensätze und Ground Truth
- repräsentative, schwierige und kritische Eingaben auswählen
- reale Fälle, anonymisierte Produktionsfälle und synthetische Ergänzungen
- Golden Datasets mit Kontext und erwarteten Eigenschaften
- fachlich geprüfte Referenzen und menschliche Annotation
- Positiv-, Negativ- und unbeantwortbare Fälle
- Versionierung, Herkunft und Coverage des Datensatzes
Testentwurf und Robustheit
- klassische Testentwurfsverfahren auf LLM-Systeme übertragen
- risikobasiertes und exploratives Testen
- metamorphe Tests mit erwarteten Beziehungen
- Perturbationen von Formulierung, Reihenfolge und Format
- mehrdeutige, fehlerhafte und unerwartete Eingaben
- Stabilität bei semantisch äquivalenten Eingaben
Halluzinationen, Abstention und Konsistenz
- erfundene Fakten, Quellen und Funktionen erkennen
- unbeantwortbare Fragen und fehlende Informationen testen
- kontrolliertes Nichtwissen, Rückfragen und Eskalation
- gleiche und semantisch gleiche Fragen wiederholt prüfen
- fachliche Widersprüche und unnötige Varianz erkennen
- Halluzination und Abstention messbar machen
Automatisierte Evaluation
- Evaluationspipeline von Testfall bis Report
- Schemas, Regeln und bekannte Fakten deterministisch prüfen
- semantische Metriken gezielt einsetzen
- Retrieval-, Qualitäts-, Performance- und Kostenmetriken kombinieren
- Ergebnisse gegen Baselines vergleichen
- Grenzen eines einzelnen Quality Scores
LLM-as-a-Judge und Human Evaluation
- Bewertungsprompts, Rubriken und Referenzantworten
- Scores, Klassifikation und Paarvergleich
- Bias, Positionseffekte und Modellabhängigkeit
- Judge-Ergebnisse gegen menschliche Bewertungen kalibrieren
- Fachexperten und Stichproben gezielt einsetzen
- Begründungen des Judge nicht mit Wahrheit verwechseln
Regression und Reproduzierbarkeit
- Prompt-, Modell-, Provider- und Kontextänderungen absichern
- Modellversion, Parameter und Promptversion protokollieren
- Retrieval-, Tool- und Testumgebung reproduzierbar erfassen
- nichtdeterministische Regressionen statistisch bewerten
- Promptvarianten und Modelle unter gleichen Bedingungen vergleichen
- Qualitätsverlust gegenüber einer Baseline erkennen
RAG-Systeme testen
- Ingestion, Chunking, Retrieval und Ranking getrennt prüfen
- Precision, Recall, Hit Rate und Ground Truth für Retrieval
- unbeantwortbare Queries und fehlendes Wissen
- Groundedness und Faithfulness der Antwort
- Quellenbezug, widersprüchliche Quellen und erfundene Belege
- End-to-End-Regression über Retrieval, Kontext und Generierung
Tool Use, Function Calling und MCP testen
- Tool-Auswahl, Parameter und erwartete Aufrufe
- unnötige oder unerlaubte Tool-Nutzung erkennen
- Fehler, ungültige Werte und Ergebnisverarbeitung
- Modelloutput und tatsächliche Ausführung getrennt prüfen
- MCP Tool Discovery, Schemas und Berechtigungen
- manipulierte Tool-Ergebnisse und Serverfehler
Agentische Systeme testen
- Zielerreichung, Planung und Aktionsfolgen
- Zwischenzustände und erlaubte Wege zum Ergebnis
- Abbruch, Eskalation und Recovery
- Schleifen, Kontextverlust und unnötige Aktionen
- Delegation, Übergaben und Fehlerfortpflanzung in Multi-Agent-Systemen
- Erfolg nicht nur am Endergebnis bewerten
Threat Modeling für LLM-Anwendungen
- Assets, Akteure und Trust Boundaries
- Datenflüsse und Eingabekanäle
- externe Dokumente, Webseiten, APIs und Tools als Angriffsfläche
- Memory und andere Agenten berücksichtigen
- Abuse Cases und mögliche Auswirkungen
- konkrete Security-Tests aus Bedrohungen ableiten
Prompt Injection und Datenexfiltration
- direkte Prompt Injection und Umgehung von System Instructions
- indirekte Injection über Dokumente, Webseiten und Tool-Ausgaben
- RAG-Inhalte und andere untrusted Inputs
- System Prompt, vertraulichen Kontext und Secrets schützen
- Exfiltrationspfade über Tools und externe Kanäle
- Angriffsvarianten als Regressionstests erhalten
Berechtigungen, Tools und Memory absichern
- Rollen, Mandanten und erlaubte Aktionen
- Least Privilege und serverseitige Autorisierung
- gefährliche Parameter und Injection in nachgelagerte Systeme
- unzulässige Schreibzugriffe und Tool-Komposition
- Benutzertrennung, Persistenz und Löschung im Memory
- Memory Poisoning und manipulierte gespeicherte Informationen
Adversarial Testing und Red Teaming
- Angriffshypothesen aus dem Threat Model ableiten
- widersprüchliche Instruktionen und ungewöhnliche Formate
- mehrsprachige Angriffe, Encoding und Kontextmanipulation
- manuelle Exploration mit automatisierten Varianten verbinden
- Findings klassifizieren und in Regressionstests überführen
- Datenschutz, Logging und Provider-Nutzung mitprüfen
Performance, Kosten und Resilience
- Antwortzeit und Time-to-first-token
- lange Kontexte, parallele Nutzer und Rate Limits
- Token-, Retrieval-, Reranking- und Agentenkosten
- Timeouts, Provider- und Tool-Ausfälle
- Retry, Backpressure, Fallback und Degraded Mode
- Performance- und Kostenregressionen erkennen
Observability, Quality Gates und CI/CD
- Prompt-, Modell-, Retrieval- und Tool-Versionen nachvollziehbar erfassen
- Produktionsfehler und Benutzerfeedback in neue Tests überführen
- Testpyramide aus deterministischen Tests, Evals und End-to-End-Tests
- kritische Qualitäts-, Security-, Performance- und Kostenkriterien
- Evals bei Prompt-, Modell- und Retrievaländerungen ausführen
- Quality Gates für Pull Requests und Releases
Praxis: eine belastbare Teststrategie entwickeln
- Qualitätsmerkmale und Risiken eines Praxisfalls bestimmen
- Evaluationsdatensatz und geeignete Orakel festlegen
- deterministische Checks und modellbasierte Bewertung kombinieren
- RAG-, Tool- oder Agentenanteile gezielt absichern
- Security- und Robustheitstests priorisieren
- Regression, Observability und Quality Gates zusammenführen
03 Durchführung
Rahmen und Organisation
Inhouse-Schulungen
04 Zielgruppe
Für wen ist der Kurs gedacht?
Der Kurs richtet sich an Test Engineers, Test Automation Engineers, Quality Engineers, Softwareentwickler, AI Engineers, Softwarearchitekten und Security-affine technische Consultants, die für die Qualität und Absicherung von LLM-basierten Anwendungen verantwortlich sind.
Er eignet sich insbesondere für Teams, die LLM-Anwendungen, RAG-Systeme oder AI Agents nicht nur funktional ausprobieren, sondern systematisch testen, evaluieren und für einen produktiven Einsatz absichern wollen.
Voraussetzungen
05 Lernziele
Was Sie nach dem Kurs können
- Qualitätsmerkmale für LLM-Anwendungen operationalisieren
- testbare Anforderungen und Akzeptanzkriterien formulieren
- geeignete Testorakel für probabilistische Systeme auswählen
- Evaluationsdatensätze und Ground Truth entwickeln
- klassische Testentwurfsverfahren auf LLM-Systeme übertragen
- metamorphe und Robustheitstests entwickeln
- Halluzinationen und Abstention systematisch testen
- automatisierte Evaluationspipelines aufbauen
- deterministische, semantische und modellbasierte Bewertungen kombinieren
- LLM-as-a-Judge kritisch und kontrolliert einsetzen
- Regressionen bei Prompt- und Modelländerungen erkennen
- RAG-Systeme auf Retrieval- und Antwortqualität testen
- Tool-, MCP- und Agentenverhalten prüfen
- Prompt-Injection- und Datenexfiltrationsszenarien entwickeln
- Berechtigungen und Tool-Grenzen verifizieren
- Threat Modeling und Red Teaming in die Teststrategie integrieren
- Performance-, Kosten- und Resilience-Anforderungen testen
- Produktionsbeobachtungen in neue Tests überführen
- Evals und Quality Gates in CI/CD integrieren
- eine vollständige Teststrategie für eine LLM-Anwendung entwickeln
06 FAQ
Häufige Fragen
Was unterscheidet diesen Kurs von KI in Qualitätssicherung und Testautomatisierung?
Jener Kurs betrachtet das gesamte Quality Engineering unter dem Einfluss generativer KI. Dazu gehört sowohl der Einsatz von KI für Testanalyse, Testdesign und Testautomatisierung als auch ein Überblick über das Testen AI-basierter Systeme.
Dieser Kurs spezialisiert sich vollständig auf LLM-basierte Systeme als Testobjekt. Evaluation, RAG-Qualität, Tool Use, Agenten, Prompt Injection, Red Teaming, Regression und Quality Gates werden deshalb wesentlich tiefer behandelt.