Heim›Whitepapers›RAG-Benchmark-Whitepaper

Technisches Whitepaper

Retrieval-Augmented Generation für Unternehmenswissen

Ein praxisnaher Benchmark aus der Goalz.Work Knowledge Pipeline: 93,31 TP3T Recall@1 bei einem Korpus mit 556 Chunks und 7 Dokumenten – bei Gesamtverarbeitungskosten von 1 TP4T0,18 USD.

93.3%

Rückruf@1

$0.18

Gesamtbearbeitungskosten

556

Teile / 7 Dokumente

Rückruf@1 / @3 / @5

93.3%

Mittlerer reziproker Rang

0.933

Korpusgröße

7 Dokumente

Gesamtkosten

$0.18

Zusammenfassung

Echte, reproduzierbare Ergebnisse – keine simulierten Benchmarks

Das Entwicklerteam von Carmatec hat eine produktionsorientierte RAG-Pipeline mit dem Codenamen „Knowledge Pipeline“ entwickelt und getestet, um die unternehmenseigenen Dokumente über MCP für KI-Assistenten durchsuchbar und auswertbar zu machen.

7 Dokumente

556 abrufbare Textabschnitte

93.3 %

Rückruf@1, @3 und @5

0.933

Mittlerer reziproker Rang

$0.18

Gesamtbearbeitungskosten, USD

So wird es gebaut

Ein selbst gehosteter Stack, der auf jeder Ebene speziell für diesen Zweck entwickelt wurde

Vier spezialisierte Datenspeicher, die ausschließlich über APIs und Nachrichtenwarteschlangen miteinander verbunden sind – niemals über direkten Datenbankzugriff –, sodass sich die Pipeline unabhängig von der Kernanwendung weiterentwickelt.

Warteschlange

RabbitMQ

Die Massenübernahme läuft vollständig über die Nachrichtenwarteschlange ab – egal, ob es sich um ein Dokument oder um zehntausend handelt, es wird immer derselbe Codepfad verwendet.

Vektoren

Qdrant

Speziell entwickelte Vektorähnlichkeitssuche über Einbettungen mit Metadatenfilterung.

Grafik

Neo4j

Stellt Dokumente und Abschnitte als Knoten und ihre Beziehungen als Kanten dar.

Geschäft

MongoDB

Speicherung von Dokumenten und Chunks neben der CakePHP-Kernanwendung.

Fünf Schritte, jedes Dokument

1

Parsen

Die Struktur wird deterministisch extrahiert, sofern das Format dies zulässt.

2

Chunking

12.5%-Überlappung zwischen benachbarten Chunks, um „Context-Cliff“-Fehler zu vermeiden.

3

Bereicherung

Die von LLM generierten Überschriften und Schlüsselwörter ordnen jeden Abschnitt in einen Kontext ein.

4

Einbettung + Speicherung

Gemini-Aufgabentyp-Parameter, die explizit für die asymmetrische Optimierung festgelegt wurden.

Im Vergleich

Auf Augenhöhe mit – oder sogar besser als – die veröffentlichten Branchenzahlen

Bei 14 von 15 Suchanfragen wurde das erwartete Quelldokument als oberstes Ergebnis angezeigt, gemessen anhand eines echten, kuratierten First-Party-Korpus.

Naives RAG (Industrie, 70–80%)

Webdesigner

75%

Hybride Abfrage (Industrie, ~91%)

Webdesigner

91%

Carmatec-Wissenspipeline

Webdesigner

93.3%

Nein.

Ehrlich gemeldetes negatives Ergebnis: Ein Ablationstest der von Anthropic entwickelten “Contextual Retrieval”-Technik ergab bei diesem Korpus keinen messbaren Genauigkeitsgewinn – da sich die sieben Dokumente thematisch bereits deutlich voneinander unterscheiden. Wir erwarten einen messbaren Nutzen bei größeren, homogeneren Korpora und planen, den Test dann erneut durchzuführen.

Aus dem Build

Technische Erkenntnisse – solche, die man nur durch die Umsetzung von Projekten gewinnt

Jeder einzelne davon wurde durch Tests an einem realen System aufgedeckt und nicht einfach als gegeben vorausgesetzt.

01

Die Einbettungs-API von Gemini akzeptiert stillschweigend Anfragen, bei denen der Parameter „task-type“ fehlt – das kann leicht übersehen werden, wenn man die Dokumentation des Anbieters nicht direkt liest.

02

Qdrant lehnt frei formatierte Zeichenfolgen-Bezeichner grundsätzlich ab; Punkt-IDs müssen entweder eine UUID oder eine vorzeichenlose Ganzzahl sein.

03

Der Dead-Letter-Routing-Schlüssel einer Nachrichtenwarteschlange muss den ursprünglichen Routing-Schlüssel beibehalten – eine Platzhalter-Überschreibung funktioniert bei der erneuten Zustellung nicht als Platzhalter.

04

Nicht jedes echte Dokument ist wohlgeformtes Markdown – eine Spezifikation für einfachen Text lieferte überhaupt keine Chunks, bis ein Fallback-Pfad hinzugefügt wurde.

05

Test-Fixtures und reale Daten dürfen niemals denselben Identifikator-Namensraum nutzen – eine Kollision führte einmal dazu, dass bei der Bereinigung nach dem Test reale Daten gelöscht wurden.

Geltungsbereich

Von Grund auf branchenunabhängig konzipiert

Die Kategorisierung von Dokumenten basiert auf Daten und nicht auf fest programmierter Logik – dieselbe Architektur gilt für jede Organisation, die große Mengen an unstrukturiertem Wissen verwaltet.

IT-Dienstleistungen

Unterstützung bei Architekturentscheidungen auf der Grundlage früherer Entwürfe und Schätzungen.

Rechtsberatung

Recherche nach Vertragsklauseln und Präzedenzfällen in der eigenen Fallhistorie der Kanzlei.

Gesundheitspflege

Recherche zu klinischen Protokollen und Standardarbeitsanweisungen auf der Grundlage dokumentierter Verfahren.

Finanzdienstleistungen

Einhaltung gesetzlicher Vorschriften und Abruf von Informationen aus dem Prüfpfad.

Herstellung

Abruf von Arbeitsanweisungen und Gerätehandbüchern in der Fertigung.

Personalwesen & People Ops

Eine Suche nach Richtlinien, die auch bei Änderungen an den Dokumenten präzise bleibt.

Ausbildung

Abruf von Lehrplänen und Kursmaterialien aus einer Inhaltsbibliothek.

Regierung

Recherche nach Vorschriften und Richtlinien mit vollständiger Rückverfolgbarkeit der Quellen.

Wie geht es weiter?

Systematische, wohlüberlegte nächste Schritte

1

Neubewertung und hybride Suche (Schlüsselwort + Vektor) – der aktuelle Produktionsstandard als Ausgangsbasis für weitere Genauigkeitsgewinne.

2

Ein größeres, heterogeneres Eingabekorpus, um die Ablation der kontextuellen Anreicherung erneut zu testen.

3

Durchsetzung von Berechtigungen zum Zeitpunkt des Abrufs, wodurch eine potenzielle Lücke in der Zugriffskontrolle geschlossen wird, die bei der Entwurfsprüfung festgestellt wurde.

4

OCR-Erfassung für gescannte und bildbasierte Dokumente, bereits auf Anwendungsfälle im Zusammenhang mit Mitarbeiterdokumenten ausgerichtet.

5

Replikation der Staging- und Produktionsinfrastruktur, bewusst erst nach diesem Test durchgeführt.

Laden Sie das vollständige Whitepaper herunter

Jede Behauptung stützt sich auf einen tatsächlichen, reproduzierbaren Pipeline-Lauf und unabhängig überprüfte Abfragen.

Über den Autor

Verfasst von der Geschäftsleitung von Carmatec

Konzern-CEO und Architekt für Unternehmens-KI-Lösungen, Carmatec

Aromal ist Technologieunternehmer und KI-Architekt für Unternehmen mit mehr als 25 Jahren Erfahrung in den Bereichen Softwareentwicklung, Cloud-Infrastruktur, Rechenzentrumsbetrieb und Geschäftstransformation. Als Group CEO ist er maßgeblich an der Konzeption der Unternehmens-KI-Plattformen, Multi-Agenten-Systeme und wissensbasierten Anwendungen beteiligt, deren Entwicklung er bei Carmatec leitet – darunter auch die RAG- und Unternehmenswissenssysteme, die in diesem Benchmark-Bericht behandelt werden. Sein aktueller technischer Schwerpunkt umfasst Retrieval-Augmented Generation, Agentenorchestrierung, Integrationen des Model Context Protocol sowie KI-Governance und Produktionsreife.