Hem›Vitböcker›RAG Benchmark – vitbok

Teknisk rapport

Generering med stöd av återvinning för Företags kunskap

Ett verklighetsbaserat jämförelsetest från Goalz.Works Knowledge Pipeline: 93,31 TP3T Recall@1 för ett korpus bestående av 556 chunkar och 7 dokument — till en total bearbetningskostnad på 1 TP4T0,18 USD.

93.3%

Återkallelse@1

$0.18

Totala bearbetningskostnader

556

Delar / 7 dokument

Återkallelse@1 / @3 / @5

93.3%

Medelvärde för den reciproka rangordningen

0.933

Corpusstorlek

7 dokument

Total kostnad

$0.18

Sammanfattning

Verkliga, reproducerbara resultat – inte simulerade jämförelsetester

Carmatecs teknikteam har utvecklat och utvärderat en produktionsinriktad RAG-pipeline, med kodnamnet Knowledge Pipeline, för att göra organisationens egna dokument sökbara och möjliggöra att AI-assistenter kan analysera dem via MCP.

7 dokument

556 textavsnitt som går att hämta

93.3 %

Återkallning@1, @3 och @5

0.933

Medelvärde för den reciproka rangordningen

$0.18

Total bearbetningskostnad, USD

Hur den är konstruerad

En egenhostad plattform, specialutvecklad på varje nivå

Fyra specialiserade datalager, som endast är kopplade till varandra via API:er och meddelandeköer – aldrig direkt databasåtkomst – så att pipelinen kan utvecklas oberoende av kärnapplikationen.

Kö

RabbitMQ

Massinläsning sker helt och hållet via meddelandekön – oavsett om det gäller ett dokument eller tiotusen så används samma kodväg.

Vektorer

Qdrant

En specialutvecklad sökfunktion för vektorlikhet baserad på inbäddningar, med filtrering av metadata.

Diagram

Neo4j

Visar dokument och avsnitt som noder och deras relationer som kanter.

Butik

MongoDB

Lagring av dokument och dataenheter tillsammans med CakePHP-kärnapplikationen.

Fem steg, varje dokument

1

Analys

Strukturen extraheras deterministiskt där formatet tillåter det.

2

Chunking

12.5%-överlappning mellan intilliggande block för att undvika ”context-cliff”-fel.

3

Berikning

De rubriker och nyckelord som genereras av LLM placerar varje avsnitt i sitt sammanhang.

4

Inbäddning + lagring

Parametrar av typen ”Gemini” som ställts in uttryckligen för asymmetrisk optimering.

Jämfört med branschstandard

I nivå med – eller bättre än – publicerade branschuppgifter

I 14 av 15 sökningar visades det förväntade källdokumentet som det högst rankade resultatet, mätt mot ett verkligt, sammanställt förstahandskorpus.

Naiv RAG (industri, 70–80%)

Webbdesigner

75%

Hybridhämtning (bransch, ~91%)

Webbdesigner

91%

Carmatecs kunskapsflöde

Webbdesigner

93.3%

Nej.

Ett ärligt redovisat negativt resultat: Ett ablationstest av Anthropics teknik för “kontextuell sökning” visade ingen mätbar förbättring av träffsäkerheten på detta korpus – eftersom vart och ett av de sju dokumenten redan är tematiskt distinkt. Vi förväntar oss en mätbar förbättring på större, mer homogena korpusar och planerar att göra ett nytt test då.

Från byggprocessen

Tekniska lärdomar – av det slag som man bara lär sig genom att släppa produkter

Var och en av dessa upptäcktes genom tester mot ett verkligt system, inte genom antaganden.

01

Gemini:s inbäddnings-API accepterar utan att ge någon varning förfrågningar där parametern för uppgiftstyp saknas — något som är lätt att missa om man inte läser leverantörens dokumentation direkt.

02

Qdrant tillåter inte strängidentifierare i fri form överhuvudtaget; punkt-ID:n måste vara ett UUID eller ett heltal utan tecken.

03

En meddelandekös ”dead-letter”-routeringsnyckel måste behålla den ursprungliga routeringsnyckeln – en jokerteckenöverskrivning fungerar inte som ett jokertecken vid återleverans.

04

Inte alla riktiga dokument är korrekt formaterade enligt Markdown – en specifikation för ren text genererade inga segment alls förrän en reservlösning lades till.

05

Testuppställningar och verkliga data får aldrig dela samma identifieringsnamnområde – en kollision ledde en gång till att verkliga data raderades i samband med testuppstädningen.

Tillämpningsområde

Utformad för att fungera i alla branscher

Dokumentkategorisering bygger på data, inte på fastkodad logik – samma arkitektur gäller för alla organisationer som hanterar stora mängder ostrukturerad kunskap.

IT-tjänster

Stöd för arkitekturbeslut baserat på tidigare konstruktioner och beräkningar.

Juridiska tjänster

Sökning efter avtalsklausuler och prejudikat i företagets egna tidigare ärenden.

Sjukvård

Sökning efter kliniska protokoll och standardrutiner (SOP) baserad på dokumenterade förfaranden.

Finansiella tjänster

Efterlevnad av regelverk och återhämtning av information ur revisionsspår.

Tillverkning

Åtkomst till standardrutiner och bruksanvisningar för utrustning på verkstadsgolvet.

HR och personaladministration

En sökfunktion för policyer som förblir korrekt även när dokumenten ändras.

Utbildning

Sökning efter läroplaner och kursmaterial i ett innehållsbibliotek.

Regeringen

Sökning efter förordningar och riktlinjer med fullständig spårbarhet till källan.

Vad händer härnäst?

Systematiska, väl genomtänkta nästa steg

1

Omrankning och hybridsökning (nyckelord + vektor) – den nuvarande standarden i produktionsmiljön för ytterligare förbättringar av träffsäkerheten.

2

Ett större och mer heterogent intagskorpus för att på nytt testa borttagningen av kontextuell berikning.

3

Genomförande av behörighetskontroll vid hämtningstidpunkten, vilket åtgärdar en potentiell brist i åtkomstkontrollen som identifierades under konstruktionsgranskningen.

4

OCR-inläsning av skannade och bildbaserade dokument, redan anpassad för användningsfall med personaldokument.

5

Replikering av infrastrukturen för iscensättning och produktion, som medvetet planerats att ske efter detta test.

Ladda ner hela rapporten

Varje påstående stöds av en verklig, reproducerbar pipelinekörning och oberoende verifierade sökfrågor.

Om författaren

Författat av Carmatecs ledning

Koncern-VD och arkitekt för AI-lösningar för företag, Carmatec

Aromal är en teknikentreprenör och AI-arkitekt för företag med mer än 25 års erfarenhet inom mjukvaruutveckling, molninfrastruktur, drift av datacenter och affärstransformation. Som koncern-VD är han aktivt delaktig i utformningen av de AI-plattformar för företag, multiagent-system och kunskapsdrivna applikationer som han leder Carmatec i utvecklingen av – inklusive de RAG- och företagskunskapssystem som denna benchmarkrapport handlar om. Hans nuvarande tekniska fokus spänner över Retrieval-Augmented Generation, agentorkestrering, integrationer av Model Context Protocol samt AI-styrning och produktionsberedskap.