Frage Nachvollziehbar belegt

Fachwissen für digitale Entscheidungen

Wie bindet man interne Dokumente mit RAG an einen LLM-Server an?

Kurzantwort

Bei RAG werden Dokumente extrahiert, in nachvollziehbare Abschnitte geteilt, als Vektoren indexiert und zur Frage passend abgerufen. Produktiv wird das Verfahren erst mit Quellenangabe, Versionsstand und serverseitigen Zugriffsfiltern; ein Vektorindex ohne Rechteprüfung kann vertrauliche Textstellen an falsche Nutzer liefern.

Ein kontrollierter Datenweg statt eines Datei-Uploads

Retrieval-Augmented Generation, kurz RAG, verbindet ein Sprachmodell zur Laufzeit mit externem Wissen. Der 2020 veröffentlichte ursprüngliche RAG-Ansatz kombiniert eine abrufbare Wissensbasis mit einem generativen Modell. Für interne Dokumente braucht es dafür eine nachvollziehbare Verarbeitungskette: Quelle erfassen, Text extrahieren, Abschnitte bilden, Embeddings berechnen, indexieren, passende Abschnitte abrufen und die Antwort mit Belegen erzeugen.

Jeder Abschnitt sollte Metadaten mitführen: Dokument-ID, Titel, Version, Sprache, Gültigkeitsdatum, Mandant und erlaubte Rollen. Qdrant empfiehlt, Textabschnitte als getrennte Punkte abzulegen; Absatzgrenzen sind für Fließtext ein sinnvoller Start, während technische Nachschlagewerke kleinere Einheiten benötigen können. Eine universell richtige Abschnittslänge gibt es nicht. Sie wird mit echten Fragen getestet.

Was im produktiven Ablauf wichtig ist

  1. Ingestion: Nur freigegebene Formate und Versionen werden übernommen. OCR-Fehler, Tabellen und Anhänge brauchen eigene Qualitätskontrollen.
  2. Index: Vektoren ermöglichen Ähnlichkeitssuche. Systeme wie pgvector bieten exakte Suche sowie HNSW und IVFFlat für beschleunigte, angenäherte Suche; mehr Geschwindigkeit kann dabei Recall kosten.
  3. Abruf: Filter für Mandant, Rolle, Dokumentstatus und Sprache werden vor oder zusammen mit der Vektorsuche serverseitig angewandt. Der Prompt darf diese Kontrolle nicht ersetzen.
  4. Antwort: Das Modell erhält nur die nötigen Fundstellen, nennt Dokument und Version und soll bei fehlender Evidenz klar ablehnen. Eine Quellenliste muss auf tatsächlich verwendete Textstellen zeigen.
  5. Pflege: Gelöschte oder ersetzte Dokumente werden auch aus dem Index entfernt. Änderungen laufen inkrementell, bleiben aber über Protokoll und Prüfsumme nachvollziehbar.

Für die Abnahme braucht es einen festen Fragenkatalog. Gemessen werden nicht nur sprachlich gute Antworten, sondern auch Retrieval-Treffer, Berechtigungsfehler und korrekte Belege. Ein Startwert wie 3 bis 8 abgerufene Abschnitte ist lediglich ein Testbereich; die richtige Zahl hängt von Dokumenten, Modell und Kontextfenster ab.

Kernfakten

RAG-Grundlagenarbeit
2020 veröffentlicht; 6 Schritte im betrieblichen Datenweg
Metadaten
Dokument-ID, Version, Sprache, Mandant und Rollen je Abschnitt
Testbereich
3 bis 8 Fundstellen als Ausgangspunkt, nicht als allgemeiner Standard

Quellen

Alle externen Angaben nachvollziehbar belegt.
  1. 01
  2. 02
  3. 03

Bereit für Ihr nächstes Projekt?

Kostenloses Erstgespräch - ohne Verkaufsdruck, mit klaren Antworten.

Beratung anfragen