KI- & LLM-Integration

KI-Integration für Unternehmen mit dem Menschen als letzter Instanz.

KI für Unternehmen, ohne Zauberei: Wir binden Sprachmodelle an die Systeme an, die Sie bereits nutzen - Dokumente, ERP, Postfach, Ticketsystem - und zwar für Aufgaben, die sie wirklich gut können. Antworten aus Ihren eigenen Unterlagen, Daten aus Belegen auslesen, Anfragen sortieren. Jede Funktion kommt mit Testdatensatz, menschlicher Rückfallebene und sichtbaren Kosten pro Anfrage.

  • Assistenten, die aus Ihren Dokumenten antworten und die Quelle nennen.
  • Daten aus Belegen ausgelesen - die unsicheren Fälle prüft ein Mensch.
  • Alles, was sendet, bucht oder bezahlt, wartet auf die Freigabe eines Menschen.
  • Modelle in der EU oder auf eigenen Servern, personenbezogene Daten vorher maskiert.

Getestet an Ihren Daten, nicht an einer Demo

KI-Projekte, die enttäuschen, scheitern meist an derselben Stelle: Eine Demo, die mit zehn handverlesenen Beispielen funktioniert hat, trifft auf tausend echte - schiefe Scans, E-Mails in drei Sprachen, eine Richtlinie, die im Frühjahr ersetzt wurde. Deshalb sammeln wir vor dem ersten Prompt einige hundert echte Beispiele aus Ihren Daten, legen mit Ihnen fest, was eine richtige Antwort ist, und machen daraus einen Testdatensatz, der bei jeder Änderung läuft.

Dann setzen wir das Modell dort ein, wo die Arbeit ohnehin passiert - hinter Ihrer API, in der ERP-Maske, im gemeinsamen Postfach. Sprachmodelle sind gut im Lesen, Sortieren und Formulieren; schlecht im Rechnen und darin, zu wissen, was sie nicht wissen. Das übernimmt der Code drumherum: Quellenangaben, Validierungsregeln, Konfidenzschwellen, Berechtigungen und ein Audit-Log.

Wir sind an keinen Anbieter gebunden: gehostete Modelle von OpenAI, Anthropic, Google oder Mistral in EU-Regionen oder Open-Weight-Modelle wie Llama, Mistral oder Qwen auf Ihrer eigenen Hardware. Ein Wechsel ist eine Konfigurationsänderung und ein Testlauf.

So funktioniert's

Was KI heute für Ihr Team tun kann

Kein Roboter, der jemanden ersetzt - sondern drei öde Aufgaben, die sie gut erledigt, mit einem Menschen am Steuer. Gezeigt bei einem Technikgroßhändler.

  1. Ein Kunde fragt nach Lieferzeiten. Der Assistent beantwortet das anhand Ihrer tatsächlichen Lieferbedingungen und zeigt die Seite, auf der die Antwort steht - keine erfundenen Fakten.

  2. Eine Lieferantenrechnung kommt als PDF. Die KI holt Lieferant, Beträge und Daten heraus und markiert das eine Feld, bei dem sie sich nicht sicher ist.

  3. Die KI entwirft eine Antwort an einen verärgerten Kunden und schlägt eine Gutschrift vor. Nichts geht raus, bevor jemand aus Ihrem Team auf Freigeben klickt.

office.erle-pumpen.at
Support-Assistent

Wie lange dauert die Lieferung nach Wien?

Durchsucht Ihre Dokumente…

Die Lieferung nach Wien dauert 3 Werktage. Bestellungen bis 12:00 Uhr werden noch am selben Tag versendet.

Quelle: Lieferbedingungen, Seite 2
Lieferbedingungen Seite 2

2.1Deutschland: 4 Werktage.

2.2Österreich: 3 Werktage. Bestellungen bis 12:00 Uhr werden am selben Tag versendet.

2.3Schweiz: 5 Werktage, inklusive Verzollung.

Ein KI-Assistent in einem Business-Tool: Er antwortet aus einem Firmendokument und zeigt die Quelle, liest eine Lieferantenrechnung und markiert ein unsicheres Feld und entwirft eine Antwort, die auf die Freigabe eines Menschen wartet.

In der Praxis

Beispielszenarien - die Art von Projekten, die wir umsetzen, keine Kundenreferenzen.

Service-Assistent für einen Anlagenhersteller

Das Problem
Techniker durchsuchen Handbücher, Garantiebedingungen und alte Tickets auf einem Netzlaufwerk, oft vom Handy aus. Die aktuelle Revision zu finden, endet meist mit einem Anruf im Büro.
Was wir bauen
Ein Assistent über Handbücher und gelöste Tickets, der die bestehenden Ordnerrechte respektiert, Dokument, Seite und Revision zitiert und offen sagt, wenn die Unterlagen eine Frage nicht abdecken.
  • Python
  • FastAPI
  • PostgreSQL
  • pgvector
  • Azure OpenAI (EU)
  • SvelteKit

Kreditoren-Postfach für einen Großhändler

Das Problem
Lieferantenrechnungen kommen als PDF und Scan in mehreren Sprachen. Zwei Personen tippen sie ins ERP ab, Fehler fallen erst beim Monatsabschluss auf.
Was wir bauen
Extraktion in die Eingangsrechnungsfelder des ERP mit Prüfung von Summen, USt, IBAN und Bestellbezug. Saubere Belege werden automatisch gebucht, der Rest landet mit markierten Feldern in der Prüfung.
  • TypeScript
  • Node.js
  • Tesseract OCR
  • Mistral (EU)
  • PostgreSQL
  • ERP-REST-API

Ticket-Triage für einen Softwareanbieter

Das Problem
Alle Support-Tickets landen in einer Queue, also wartet eine Störungsmeldung hinter zwanzig Passwort-Resets.
Was wir bauen
Ein Klassifikator vergibt Produkt und Dringlichkeit, leitet an das richtige Team weiter und entwirft eine erste Antwort aus der Wissensdatenbank. Unsichere Tickets bleiben in der allgemeinen Queue; die Genauigkeit wird wöchentlich an einer gelabelten Stichprobe geprüft.
  • Python
  • Llama (selbst gehostet)
  • vLLM
  • Redis
  • Helpdesk-API
  • Grafana

Was Sie bekommen

  • Ein Testdatensatz aus Ihren echten Daten, mit vereinbartem Genauigkeitsziel pro Aufgabe
  • Integration in Ihre bestehenden Systeme per API, Webhook oder Plugin
  • Eine Suche über Ihre Dokumente, die beachtet, wer was sehen darf
  • Guardrails: Maskierung personenbezogener Daten, nur freigegebene Aktionen, Freigabeschritte
  • Eine Prüfmaske für unsichere Ergebnisse, deren Korrekturen in den Testdatensatz fließen
  • Monitoring von Genauigkeit, Geschwindigkeit und Kosten pro Anfrage
  • Ein Setup, das auf ein anderes Modell oder Ihre eigenen Server umziehen kann

Typischer Stack

  • Python
  • TypeScript
  • FastAPI
  • Node.js
  • PostgreSQL + pgvector
  • Qdrant
  • OpenAI / Azure OpenAI
  • Anthropic Claude
  • Mistral
  • Llama / Qwen (selbst gehostet)
  • vLLM
  • Ollama
  • Langfuse

Häufige Fragen

Ihre Frage ist nicht dabei? Fragen Sie uns direkt - wir antworten innerhalb von zwei Werktagen.

Frage stellen
Was kostet eine KI-Integration?

Das hängt von der Zahl der Aufgaben, dem Zustand Ihrer Daten, der nötigen Genauigkeit und der Tiefe der Integration ab. Die laufenden Kosten sind vor allem Tokens pro Anfrage mal Volumen - das messen wir an einer Stichprobe Ihrer Daten. Wir antworten innerhalb von zwei Werktagen mit einem Link zu einem 30-minütigen Kennenlerngespräch und schicken danach einen schriftlichen Plan mit einer Schätzung für einen klar abgegrenzten Umfang.

Wie lange dauert es, einen KI-Chatbot entwickeln zu lassen?

Eine erste Version, die aus Ihren Dokumenten antwortet, ist der schnelle Teil. Berechtigungen, Prüfmasken, Integration und genug Tests, um dem System zu vertrauen, machen den Großteil aus. Den Zeitplan bekommen Sie im schriftlichen Plan, sobald wir die Daten gesehen haben und wissen, wo die Antworten erscheinen sollen.

Sind unsere Daten sicher, und trainiert das Modell damit?

Die Business-APIs, mit denen wir arbeiten, trainieren standardmäßig nicht mit Ihren Anfragen, und wir wählen EU-Regionen, wo der Anbieter sie anbietet. Personenbezogene Daten lassen sich vor jedem Aufruf maskieren, Zugriffe folgen Ihren bestehenden Berechtigungen. Dürfen Daten Ihr Netz nicht verlassen, betreiben wir ein Open-Weight-Modell auf Ihren eigenen Servern. Die technischen Angaben für Ihre DSGVO-Dokumentation liefern wir mit.

Wie genau ist das, und was passiert, wenn die KI falsch liegt?

Die KI wird manchmal falsch liegen, also planen wir dafür. Gemessen wird an Ihren Beispielen, nicht an einem Hersteller-Benchmark. Unter einer vereinbarten Konfidenz geht das Ergebnis an einen Menschen; Quellenangaben und Validierungsregeln fangen den Großteil des Rests ab. Jede Korrektur wird zu einem neuen Testfall.

Welches Modell nutzen Sie - ChatGPT, Claude oder Open Source?

Das Modell, das Ihren Testdatensatz zu den niedrigsten Kosten bei akzeptabler Geschwindigkeit besteht. Oft sortiert ein kleines Modell vor, und ein größeres übernimmt die komplexen Antworten. Der Anbieter sitzt hinter einer Schnittstelle, ein Umstieg auf selbst gehostetes Llama oder Qwen ist also eine Konfigurationsänderung plus Testlauf.

Bringen Sie eine echte Aufgabe und einen Stapel echter Beispiele mit.

Sagen Sie uns, welche Aufgabe Ihr Team Zeit kostet und wie die Daten aussehen. Wir antworten innerhalb von zwei Werktagen mit einem Link zu einem 30-minütigen Kennenlerngespräch und schicken danach einen schriftlichen Plan mit einer Schätzung für einen klar abgegrenzten Umfang - inklusive der Antwort, wie wir messen, ob es funktioniert.

Anwendungsfall besprechen