Technisches Whitepaper
Ein praxisnaher Benchmark aus der Goalz.Work Knowledge Pipeline: 93,31 TP3T Recall@1 bei einem Korpus mit 556 Chunks und 7 Dokumenten – bei Gesamtverarbeitungskosten von 1 TP4T0,18 USD.
Rückruf@1
Gesamtbearbeitungskosten
Teile / 7 Dokumente
Rückruf@1 / @3 / @5
93.3%
Mittlerer reziproker Rang
0.933
Korpusgröße
7 Dokumente
Gesamtkosten
$0.18
Zusammenfassung
Das Entwicklerteam von Carmatec hat eine produktionsorientierte RAG-Pipeline mit dem Codenamen „Knowledge Pipeline“ entwickelt und getestet, um die unternehmenseigenen Dokumente über MCP für KI-Assistenten durchsuchbar und auswertbar zu machen.
556 abrufbare Textabschnitte
Rückruf@1, @3 und @5
Mittlerer reziproker Rang
Gesamtbearbeitungskosten, USD
So wird es gebaut
Vier spezialisierte Datenspeicher, die ausschließlich über APIs und Nachrichtenwarteschlangen miteinander verbunden sind – niemals über direkten Datenbankzugriff –, sodass sich die Pipeline unabhängig von der Kernanwendung weiterentwickelt.
Die Massenübernahme läuft vollständig über die Nachrichtenwarteschlange ab – egal, ob es sich um ein Dokument oder um zehntausend handelt, es wird immer derselbe Codepfad verwendet.
Speziell entwickelte Vektorähnlichkeitssuche über Einbettungen mit Metadatenfilterung.
Stellt Dokumente und Abschnitte als Knoten und ihre Beziehungen als Kanten dar.
Speicherung von Dokumenten und Chunks neben der CakePHP-Kernanwendung.
Die Struktur wird deterministisch extrahiert, sofern das Format dies zulässt.
12.5%-Überlappung zwischen benachbarten Chunks, um „Context-Cliff“-Fehler zu vermeiden.
Die von LLM generierten Überschriften und Schlüsselwörter ordnen jeden Abschnitt in einen Kontext ein.
Gemini-Aufgabentyp-Parameter, die explizit für die asymmetrische Optimierung festgelegt wurden.
Im Vergleich
Bei 14 von 15 Suchanfragen wurde das erwartete Quelldokument als oberstes Ergebnis angezeigt, gemessen anhand eines echten, kuratierten First-Party-Korpus.
Ehrlich gemeldetes negatives Ergebnis: Ein Ablationstest der von Anthropic entwickelten “Contextual Retrieval”-Technik ergab bei diesem Korpus keinen messbaren Genauigkeitsgewinn – da sich die sieben Dokumente thematisch bereits deutlich voneinander unterscheiden. Wir erwarten einen messbaren Nutzen bei größeren, homogeneren Korpora und planen, den Test dann erneut durchzuführen.
Aus dem Build
Jeder einzelne davon wurde durch Tests an einem realen System aufgedeckt und nicht einfach als gegeben vorausgesetzt.
Die Einbettungs-API von Gemini akzeptiert stillschweigend Anfragen, bei denen der Parameter „task-type“ fehlt – das kann leicht übersehen werden, wenn man die Dokumentation des Anbieters nicht direkt liest.
Qdrant lehnt frei formatierte Zeichenfolgen-Bezeichner grundsätzlich ab; Punkt-IDs müssen entweder eine UUID oder eine vorzeichenlose Ganzzahl sein.
Der Dead-Letter-Routing-Schlüssel einer Nachrichtenwarteschlange muss den ursprünglichen Routing-Schlüssel beibehalten – eine Platzhalter-Überschreibung funktioniert bei der erneuten Zustellung nicht als Platzhalter.
Nicht jedes echte Dokument ist wohlgeformtes Markdown – eine Spezifikation für einfachen Text lieferte überhaupt keine Chunks, bis ein Fallback-Pfad hinzugefügt wurde.
Test-Fixtures und reale Daten dürfen niemals denselben Identifikator-Namensraum nutzen – eine Kollision führte einmal dazu, dass bei der Bereinigung nach dem Test reale Daten gelöscht wurden.
Geltungsbereich
Die Kategorisierung von Dokumenten basiert auf Daten und nicht auf fest programmierter Logik – dieselbe Architektur gilt für jede Organisation, die große Mengen an unstrukturiertem Wissen verwaltet.
Unterstützung bei Architekturentscheidungen auf der Grundlage früherer Entwürfe und Schätzungen.
Recherche nach Vertragsklauseln und Präzedenzfällen in der eigenen Fallhistorie der Kanzlei.
Recherche zu klinischen Protokollen und Standardarbeitsanweisungen auf der Grundlage dokumentierter Verfahren.
Einhaltung gesetzlicher Vorschriften und Abruf von Informationen aus dem Prüfpfad.
Abruf von Arbeitsanweisungen und Gerätehandbüchern in der Fertigung.
Eine Suche nach Richtlinien, die auch bei Änderungen an den Dokumenten präzise bleibt.
Abruf von Lehrplänen und Kursmaterialien aus einer Inhaltsbibliothek.
Recherche nach Vorschriften und Richtlinien mit vollständiger Rückverfolgbarkeit der Quellen.
Wie geht es weiter?
Neubewertung und hybride Suche (Schlüsselwort + Vektor) – der aktuelle Produktionsstandard als Ausgangsbasis für weitere Genauigkeitsgewinne.
Ein größeres, heterogeneres Eingabekorpus, um die Ablation der kontextuellen Anreicherung erneut zu testen.
Durchsetzung von Berechtigungen zum Zeitpunkt des Abrufs, wodurch eine potenzielle Lücke in der Zugriffskontrolle geschlossen wird, die bei der Entwurfsprüfung festgestellt wurde.
OCR-Erfassung für gescannte und bildbasierte Dokumente, bereits auf Anwendungsfälle im Zusammenhang mit Mitarbeiterdokumenten ausgerichtet.
Replikation der Staging- und Produktionsinfrastruktur, bewusst erst nach diesem Test durchgeführt.
Jede Behauptung stützt sich auf einen tatsächlichen, reproduzierbaren Pipeline-Lauf und unabhängig überprüfte Abfragen.
Über den Autor
Konzern-CEO und Architekt für Unternehmens-KI-Lösungen, Carmatec
Aromal ist Technologieunternehmer und KI-Architekt für Unternehmen mit mehr als 25 Jahren Erfahrung in den Bereichen Softwareentwicklung, Cloud-Infrastruktur, Rechenzentrumsbetrieb und Geschäftstransformation. Als Group CEO ist er maßgeblich an der Konzeption der Unternehmens-KI-Plattformen, Multi-Agenten-Systeme und wissensbasierten Anwendungen beteiligt, deren Entwicklung er bei Carmatec leitet – darunter auch die RAG- und Unternehmenswissenssysteme, die in diesem Benchmark-Bericht behandelt werden. Sein aktueller technischer Schwerpunkt umfasst Retrieval-Augmented Generation, Agentenorchestrierung, Integrationen des Model Context Protocol sowie KI-Governance und Produktionsreife.