LLM & Generative KI

RAG-Pipelines, Agenten und Evaluation — generative KI für Produktion, nicht für Demos.

Die meisten LLM-Projekte sehen in der Demo gut aus und fallen in der Produktion auseinander. Falsche Antworten rutschen durch, die Latenz bricht unter Last ein, und niemand hat einen verlässlichen Weg, Qualität zu messen. Ich baue Systeme mit eingebetteter Evaluation von Tag eins — damit du weißt, dass es funktioniert, bevor es live geht.

Womit ich helfe

RAG-Pipelines

Fundierte Antworten auf Basis deiner eigenen Wissensbasis — mit Quellenangaben, Zugriffssteuerung und messbarer Qualität. Vollständiger Stack: Ingestion, Chunking, Retrieval, Re-Ranking und eine Eval-Suite, die Deployments an Qualitätsmetriken hängt.

Agenten & Automatisierung

Multi-Agenten-Systeme für Dokumentenverarbeitung, Informationsextraktion, Ticket-Triage und interne Assistenten. Agency eng gefasst, Guardrails inklusive, Mensch in der Schleife wo es zählt.

Evaluation & Guardrails

Jedes System wird mit einer Regressions-Suite ausgeliefert: Golden Datasets, LLM-as-a-judge und Produktions-Monitoring für Halluzination, Kosten und Latenz.

Fine-Tuning & Anpassung

Wenn Prompting nicht reicht, trainiere oder adaptiere ich offene Modelle auf deinen Domänendaten — auf Infrastruktur, die du kontrollierst.

Typische Ergebnisse

  • Dokumentenverarbeitung 10× schneller als manuelle Bearbeitung
  • Interne Assistenten für Tausende von Mitarbeitenden mit messbarer Genauigkeit
  • Legal-Extraktion ersetzt Near-Shore-Arbeit — kostenwirksam

Womit ich arbeite

AWS Bedrock, Anthropic Claude, OpenAI, LangChain, LangGraph — anbieterflexibel, kein Vendor Lock-in.

Beispiele aus der Praxis · Produktive KI besprechen