KI & Machine Learning

RAG-Systeme: KI, die aus Ihren eigenen Daten antwortet

Antworten aus Ihren Dokumenten – mit den Quellen als Beleg.

Richten Sie einen Assistenten auf Ihre Handbücher, Richtlinien und alten Tickets. Er findet die passende Stelle, antwortet in klarer Sprache und verlinkt die Quelle, sodass sich jede Antwort nachprüfen lässt.

Ein KI-Assistent, der Ihr Unternehmen kennt.

Retrieval-Augmented Generation (RAG) verbindet ein Sprachmodell mit Ihren eigenen Informationen. Stellt jemand eine Frage, durchsucht das System zuerst Ihre Dokumente, Ihr Wiki, Ihre Tickets oder Ihre Datenbank nach den passendsten Stellen und lässt das Modell die Antwort ausschließlich daraus bilden – und zeigt, woher sie stammt. Das Modell bleibt allgemein; das Wissen bleibt Ihres und bleibt aktuell.

Ein RAG-System ist nur so gut wie seine Suche. Dort steckt der größte Teil der Arbeit: Dokumente sauber aufbereiten und sinnvoll zerlegen, Embeddings und hybride Suche wählen, Treffer neu sortieren, Leseberechtigungen beachten und die Antwortgenauigkeit an echten Fragen Ihres Teams messen, bevor sich jemand darauf verlässt.

Im Detail

Was ein RAG-System ausmacht, dem Menschen wirklich vertrauen

01Zuerst die Suche

Die meisten enttäuschenden RAG-Assistenten scheitern, bevor das Sprachmodell überhaupt beteiligt ist: Die Suche liefert die falsche Textstelle, und das Modell beantwortet die falsche Frage. Für uns ist die Suche der Kern des Produkts.

Das heißt: Dokumente entlang ihrer echten Struktur aufteilen – Abschnitte, Tabellen, Klauseln – statt nach fester Länge, semantische und Stichwortsuche kombinieren, damit Artikelnummern und Namen exakt gefunden werden, und die Ergebnisse neu sortieren, bevor das Modell sie sieht.

02Belegte Antworten mit Quellen

Der Assistent darf nur aus den gefundenen Textstellen antworten, und jede Antwort verlinkt Dokument und Abschnitt, die er genutzt hat – jeder kann sie mit einem Klick prüfen.

Wenn Ihre Dokumente die Antwort nicht enthalten, sagt er das und schlägt vor, wen man fragen kann. Ein ehrliches „Weiß ich nicht“ ist es, was Vertrauen in die Antworten schafft, die er gibt.

03Berechtigungen eingebaut

Ein Wissensassistent darf kein Weg um Ihre Zugriffsregeln sein. Jedes Dokument nimmt seine Berechtigungen in den Index mit, und die Suche wird nach der fragenden Person gefiltert – niemand erhält eine Antwort aus einer Datei, die er selbst nicht öffnen dürfte.

Für Assistenten im Kundenkontakt wird nur Inhalt indexiert, der zur Veröffentlichung freigegeben ist.

04Vor dem Start gemessen

Bevor sich jemand darauf verlässt, bauen wir aus echten Fragen Ihres Teams einen Testsatz mit den richtigen Antworten. Jede Version wird daran gemessen: Hat die Suche die richtige Stelle gefunden, und bleibt die Antwort ihr treu?

Nach dem Start fließen unbeantwortete Fragen und negatives Feedback in die nächste Optimierungsrunde, und der Index aktualisiert sich automatisch, wenn sich Dokumente ändern.

05Ihre Daten bleiben Ihre

Wir wählen Modelle und Hosting nach Ihren Regeln: gehostete APIs ohne Training auf Ihren Daten, Infrastruktur in einer EU-Region für die DSGVO oder offene Modelle, die vollständig in Ihrer eigenen Cloud laufen, wenn Dokumente sie nicht verlassen dürfen.

06Wo es sich zuerst auszahlt

Supportteams, die aus Handbüchern und früheren Tickets antworten; neue Mitarbeitende, die Richtlinien finden, ohne herumzufragen; Vertrieb und Operations, die in Verträgen, Spezifikationen und Prozessen suchen; und regulierte Bereiche, in denen jede Antwort auf eine Quelle verweisen muss.

Es funktioniert auch auf Deutsch, Französisch und anderen Sprachen – getestet mit echten Fragen in jeder Sprache.

RAG-Systeme

Was wir anbieten

01

Assistenten für Ihr Wissen

Interne Fragen und Antworten zu Richtlinien, Handbüchern, Wikis und alten Tickets, damit Ihre Leute nicht mehr suchen und herumfragen müssen.

02

Support-Bots für Kunden

Antworten aus Ihrem Hilfebereich und Ihrer Produktdokumentation, mit Quellen und Übergabe an einen Menschen, wenn es nötig wird.

03

Pipelines für Dokumente

Einlesen von PDFs, Word-Dateien, Webseiten, Confluence, Notion oder Datenbanken – und ein Index, der bei Änderungen aktuell bleibt.

04

Vektor- & Hybridsuche

Embeddings, Stichwortsuche und Re-Ranking kombiniert für treffsichere Ergebnisse – auf pgvector, Qdrant, Pinecone oder Elasticsearch.

05

Zugriffsrechte

Antworten, die Berechtigungen beachten: Niemand bekommt Inhalte zu sehen, die er nicht lesen darf.

06

Genauigkeit messen

Testfragen mit bekannten Antworten, Kennzahlen für Trefferqualität und Quellentreue sowie Dashboards für den Verlauf.

Wann es passt

  • Ihr Wissen verteilt sich auf Dokumente, die sich kaum durchsuchen lassen
  • Ihre Support-Leute beantworten täglich dieselben Fragen aus denselben Handbüchern
  • Sie brauchen einen KI-Assistenten, der Quellen nennt, statt nur überzeugend zu klingen
  • Ihre Informationen ändern sich zu oft, um ein Modell neu zu trainieren oder feinabzustimmen

So arbeiten wir

  1. 01Quellen erfassenWir halten fest, welche Dokumente und Systeme einfließen und wer darauf zugreifen darf, und sammeln echte Fragen samt richtiger Antworten.
  2. 02Such-PrototypEinlesen, Zerlegen und Suche werden so lange abgestimmt, bis zu Ihren Testfragen die richtigen Textstellen zurückkommen.
  3. 03Assistent & OberflächeAntworten mit Quellenangabe – in einer Web-Anwendung, in Slack, in Teams oder in Ihrem eigenen Produkt.
  4. 04Messen & betreibenGenauigkeit vor dem Start gemessen, Index-Aktualisierungen automatisiert, und Rückmeldungen der Nutzer fließen in die Feinabstimmung zurück.

Technologie

Unsere Werkzeuge für RAG-Systeme

  • LangChain
  • LlamaIndex
  • pgvector
  • Qdrant
  • Pinecone
  • Elasticsearch
  • OpenAI
  • Python

Häufige Fragen

Was ist der Unterschied zwischen RAG und Fine-Tuning?

Fine-Tuning verändert, wie ein Modell schreibt und sich verhält; RAG liefert ihm zur Frage die passenden Fakten. Für Fragen zu Ihren eigenen, sich ändernden Dokumenten ist RAG meist günstiger, leichter aktuell zu halten und kann Quellen nennen.

Welche Dokumentformate kann ein RAG-System nutzen?

PDF, Word, Excel, HTML, Markdown sowie Inhalte aus Werkzeugen wie Confluence, Notion, Google Drive, SharePoint oder Ihrer eigenen Datenbank. Gescannte Dokumente lassen sich per OCR einbinden.

Wie genau ist ein RAG-Assistent?

Wir messen das vor dem Start an echten Fragen mit bekannten Antworten und nennen Ihnen die Zahlen. Steht die Antwort nicht in Ihren Dokumenten, sagt der Assistent das – statt zu raten.

Wie verhindern Sie, dass der Assistent etwas erfindet?

Indem wir steuern, woraus er antworten darf: nur aus gefundenen Textstellen, mit einer Quellenangabe bei jeder Antwort und der ausdrücklichen Anweisung, abzulehnen, wenn die Quellen die Frage nicht abdecken. Dann testen wir mit Fragen, deren Antwort nicht in Ihren Dokumenten steht, um sicherzugehen, dass er ablehnt statt zu raten.

Wie berücksichtigen Sie, wer was sehen darf?

Berechtigungen aus den Quellsystemen gehen mit jedem Dokument in den Suchindex, und jede Suche wird nach der Identität der fragenden Person gefiltert. Man erhält nur Antworten aus Inhalten, die man ohnehin öffnen durfte.

Wie lange dauert es und was kostet es?

Ein fokussierter Assistent für einen klar abgegrenzten Dokumentenbestand ist meist in 3–6 Wochen ein funktionierender Prototyp. Die Kosten hängen von Anzahl und Zustand der Quellen, dem Berechtigungsmodell und dem Betriebsort ab; unser Kalkulator liefert in wenigen Minuten eine erste Spanne, und das anschließende Scoping-Gespräch ist kostenlos.

Geht das, ohne unsere Dokumente an OpenAI zu senden?

Ja. Wir können gehostete Modelle mit Bedingungen nutzen, die ein Training auf Ihren Daten ausschließen, alles in einer EU-Cloud-Region betreiben oder offene Modelle vollständig in Ihrer eigenen Umgebung bereitstellen.

Nächster Schritt

Erzählen Sie uns, was Sie bauen möchten.

Eine kostenlose 30-minütige Beratung mit einem Ingenieur — unverbindlich, Antwort innerhalb eines Werktags.

Kontakt aufnehmen