Lokale LLMs und eigene AI-Infrastruktur
Sprachmodelle lokal und in eigener Infrastruktur betreiben
01 Intro
02 Trainingsprogramm
Inhalte
Lokale LLMs einordnen
- Cloud API und eigener Betrieb
- vertrauliche Daten
- Datenschutz
- Kontrolle über Modelle und Infrastruktur
- Verfügbarkeit
- Offline- und abgeschottete Umgebungen
Modelle und Open Weights auswählen
- Modellfamilien
- Modellgrößen
- Parameter
- Kontextfenster
- Sprachunterstützung
- Modellwahl nach Aufgabe
Modellgröße, Quantisierung und Formate
- Parameterzahl
- Speicherbedarf
- Gewichte
- KV Cache
- Kontextgröße
- tatsächlichen Bedarf statt nur Modellgröße betrachten
CPU, GPU und Hardware dimensionieren
- Modellgröße
- Quantisierung
- Kontext
- erwartete Benutzer
- parallele Requests
- Reserve für reale Last
Inference Engines und lokaler Einstieg
- Aufgabe einer Inference Engine
- Modell laden
- Token generieren
- Speicher verwalten
- Batching
- unterschiedliche Engines nach Einsatzgebiet
Modelle als API bereitstellen
- lokale HTTP API
- standardisierte Schnittstelle
- Chat Completion
- strukturierte Requests
- Streaming
- Anwendungen vom konkreten Backend entkoppeln
Kontext, Speicher und Parallelität
- Prompt Tokens
- generierte Tokens
- KV Cache
- große Kontextfenster
- Speicherverbrauch
- maximal möglich ist nicht automatisch sinnvoll
Performance und Qualität benchmarken
- unterschiedliche Modelle
- unterschiedliche Quantisierungen
- kleinere und größere Modelle
- Geschwindigkeit
- Speicherbedarf
- Entscheidung auf Messwerte stützen
Containerisierung und Modellverwaltung
- Inference Server im Container
- Images
- GPU-Zugriff
- Modelle
- Volumes
- reproduzierbare Umgebung
Modellquellen und Supply Chain
- Herkunft des Modells
- Modellrepository
- Dateien
- ausführbarer Modellcode
- Abhängigkeiten
- fremde Artefakte kontrolliert übernehmen
Zugriffsschutz, Netzwerk und Secrets
- lokale API ist nicht automatisch ungefährlich
- Netzwerkzugriff
- Authentifizierung
- Autorisierung
- Benutzer
- Zugriff auf notwendige Systeme begrenzen
Logging, Monitoring und Kapazitätsplanung
- Requests
- Modell
- Laufzeiten
- Tokenmengen
- Fehler
- Logging-Policy
Kosten, Cloud und Hybridbetrieb
- Hardware
- GPU-Miete
- Strom
- Kühlung
- Betrieb
- Total Cost of Ownership
Model Routing und lokale Embeddings
- unterschiedliche Aufgaben
- unterschiedliche Modelle
- kleines Modell für einfache Aufgaben
- großes Modell für schwierige Aufgaben
- Coding-Modell
- Routing evaluieren
Lokale RAG- und Agenten-Infrastruktur
- Inference Server
- Embedding Service
- Vector Store
- Dokumentdaten
- Netzwerk
- RAG selbst bleibt Gegenstand des RAG-Kurses
Coding und multimodale Modelle lokal
- Text und Bild
- zusätzliche Modellkomponenten
- VRAM
- Inference
- Eingabegrößen
- Hardwarebedarf
Updates, Rollback und Recovery
- neue Modellversion
- neue Runtime
- Treiber
- Container
- Abhängigkeiten
- kontrollierter Rollout
Automatisierter Betrieb einer AI-Plattform
- Infrastructure as Code
- Konfiguration
- Container
- Deployment
- Health Checks
- reproduzierbare Systeme
Praxis: internen AI-Service aufbauen
- lokales Modell starten
- API bereitstellen
- Anwendung anbinden
- Performance messen
- Zugriffsschutz
- Betriebsprozess definieren
03 Durchführung
Rahmen und Organisation
Inhouse-Schulungen
04 Zielgruppe
Für wen ist der Kurs gedacht?
Der Kurs richtet sich an Softwareentwickler, AI Engineers, DevOps Engineers, Systemadministratoren, Softwarearchitekten und technische Consultants, die Sprachmodelle unabhängig von öffentlichen AI-Diensten betreiben oder eine eigene AI-Infrastruktur aufbauen möchten.
Er eignet sich sowohl für einzelne leistungsfähige Entwickler-Workstations als auch für Teams, die zentrale interne LLM-Dienste für Anwendungen, RAG-Systeme oder AI Agents bereitstellen wollen.
Voraussetzungen
05 Lernziele
Was Sie nach dem Kurs können
- geeignete Einsatzszenarien für lokal betriebene LLMs bestimmen
- Open-Weight-Modelle nach technischen und fachlichen Anforderungen auswählen
- Modellgröße, Quantisierung und Hardwarebedarf einordnen
- CPU-, GPU- und VRAM-Anforderungen abschätzen
- unterschiedliche Inference-Lösungen einsetzen und vergleichen
- Modelle über standardisierte APIs bereitstellen
- lokale AI-Dienste in eigene Anwendungen integrieren
- Performance reproduzierbar messen
- Qualität und Geschwindigkeit unterschiedlicher Modelle vergleichen
- Parallelität und Kapazitätsbedarf beurteilen
- Inference-Server containerisieren
- Modelle und Versionen kontrolliert verwalten
- Zugriffsschutz und Netzwerkgrenzen gestalten
- Datenschutz und Logging beim Eigenbetrieb berücksichtigen
- GPU- und Service-Monitoring aufbauen
- Kosten von Cloud- und Eigenbetrieb vergleichen
- hybride Modellstrategien entwickeln
- lokale Modelle für RAG-, Agenten- und Entwicklungsanwendungen bereitstellen
- eine eigene AI-Infrastruktur vom Experiment zum internen Dienst weiterentwickeln
06 FAQ
Häufige Fragen
Was unterscheidet diesen Kurs von der LLM-Anwendungsentwicklung mit Python?
Der Entwicklungskurs baut die Anwendung, die ein Sprachmodell verwendet. Ob dieses Modell über einen Cloudanbieter oder lokal bereitgestellt wird, ist für die grundlegende Anwendungsarchitektur zweitrangig.
Dieser Kurs behandelt die andere Seite dieser Schnittstelle: Auswahl, Bereitstellung und Betrieb der Modelle und der dafür notwendigen Infrastruktur.