LLM & Generative KI
RAG-Pipelines, Agenten und Evaluation — generative KI für Produktion, nicht für Demos.
Die meisten LLM-Projekte sehen in der Demo gut aus und fallen in der Produktion auseinander. Falsche Antworten rutschen durch, die Latenz bricht unter Last ein, und niemand hat einen verlässlichen Weg, Qualität zu messen. Ich baue Systeme mit eingebetteter Evaluation von Tag eins — damit du weißt, dass es funktioniert, bevor es live geht.
Womit ich helfe
RAG-Pipelines
Fundierte Antworten auf Basis deiner eigenen Wissensbasis — mit Quellenangaben, Zugriffssteuerung und messbarer Qualität. Vollständiger Stack: Ingestion, Chunking, Retrieval, Re-Ranking und eine Eval-Suite, die Deployments an Qualitätsmetriken hängt.
Agenten & Automatisierung
Multi-Agenten-Systeme für Dokumentenverarbeitung, Informationsextraktion, Ticket-Triage und interne Assistenten. Agency eng gefasst, Guardrails inklusive, Mensch in der Schleife wo es zählt.
Evaluation & Guardrails
Jedes System wird mit einer Regressions-Suite ausgeliefert: Golden Datasets, LLM-as-a-judge und Produktions-Monitoring für Halluzination, Kosten und Latenz.
Fine-Tuning & Anpassung
Wenn Prompting nicht reicht, trainiere oder adaptiere ich offene Modelle auf deinen Domänendaten — auf Infrastruktur, die du kontrollierst.
Typische Ergebnisse
- Dokumentenverarbeitung 10× schneller als manuelle Bearbeitung
- Interne Assistenten für Tausende von Mitarbeitenden mit messbarer Genauigkeit
- Legal-Extraktion ersetzt Near-Shore-Arbeit — kostenwirksam
Womit ich arbeite
AWS Bedrock, Anthropic Claude, OpenAI, LangChain, LangGraph — anbieterflexibel, kein Vendor Lock-in.