Teknisk rapport
Ett verklighetsbaserat jämförelsetest från Goalz.Works Knowledge Pipeline: 93,31 TP3T Recall@1 för ett korpus bestående av 556 chunkar och 7 dokument — till en total bearbetningskostnad på 1 TP4T0,18 USD.
Återkallelse@1
Totala bearbetningskostnader
Delar / 7 dokument
Återkallelse@1 / @3 / @5
93.3%
Medelvärde för den reciproka rangordningen
0.933
Corpusstorlek
7 dokument
Total kostnad
$0.18
Sammanfattning
Carmatecs teknikteam har utvecklat och utvärderat en produktionsinriktad RAG-pipeline, med kodnamnet Knowledge Pipeline, för att göra organisationens egna dokument sökbara och möjliggöra att AI-assistenter kan analysera dem via MCP.
556 textavsnitt som går att hämta
Återkallning@1, @3 och @5
Medelvärde för den reciproka rangordningen
Total bearbetningskostnad, USD
Hur den är konstruerad
Fyra specialiserade datalager, som endast är kopplade till varandra via API:er och meddelandeköer – aldrig direkt databasåtkomst – så att pipelinen kan utvecklas oberoende av kärnapplikationen.
Massinläsning sker helt och hållet via meddelandekön – oavsett om det gäller ett dokument eller tiotusen så används samma kodväg.
En specialutvecklad sökfunktion för vektorlikhet baserad på inbäddningar, med filtrering av metadata.
Visar dokument och avsnitt som noder och deras relationer som kanter.
Lagring av dokument och dataenheter tillsammans med CakePHP-kärnapplikationen.
Strukturen extraheras deterministiskt där formatet tillåter det.
12.5%-överlappning mellan intilliggande block för att undvika ”context-cliff”-fel.
De rubriker och nyckelord som genereras av LLM placerar varje avsnitt i sitt sammanhang.
Parametrar av typen ”Gemini” som ställts in uttryckligen för asymmetrisk optimering.
Jämfört med branschstandard
I 14 av 15 sökningar visades det förväntade källdokumentet som det högst rankade resultatet, mätt mot ett verkligt, sammanställt förstahandskorpus.
Ett ärligt redovisat negativt resultat: Ett ablationstest av Anthropics teknik för “kontextuell sökning” visade ingen mätbar förbättring av träffsäkerheten på detta korpus – eftersom vart och ett av de sju dokumenten redan är tematiskt distinkt. Vi förväntar oss en mätbar förbättring på större, mer homogena korpusar och planerar att göra ett nytt test då.
Från byggprocessen
Var och en av dessa upptäcktes genom tester mot ett verkligt system, inte genom antaganden.
Gemini:s inbäddnings-API accepterar utan att ge någon varning förfrågningar där parametern för uppgiftstyp saknas — något som är lätt att missa om man inte läser leverantörens dokumentation direkt.
Qdrant tillåter inte strängidentifierare i fri form överhuvudtaget; punkt-ID:n måste vara ett UUID eller ett heltal utan tecken.
En meddelandekös ”dead-letter”-routeringsnyckel måste behålla den ursprungliga routeringsnyckeln – en jokerteckenöverskrivning fungerar inte som ett jokertecken vid återleverans.
Inte alla riktiga dokument är korrekt formaterade enligt Markdown – en specifikation för ren text genererade inga segment alls förrän en reservlösning lades till.
Testuppställningar och verkliga data får aldrig dela samma identifieringsnamnområde – en kollision ledde en gång till att verkliga data raderades i samband med testuppstädningen.
Tillämpningsområde
Dokumentkategorisering bygger på data, inte på fastkodad logik – samma arkitektur gäller för alla organisationer som hanterar stora mängder ostrukturerad kunskap.
Stöd för arkitekturbeslut baserat på tidigare konstruktioner och beräkningar.
Sökning efter avtalsklausuler och prejudikat i företagets egna tidigare ärenden.
Sökning efter kliniska protokoll och standardrutiner (SOP) baserad på dokumenterade förfaranden.
Efterlevnad av regelverk och återhämtning av information ur revisionsspår.
Åtkomst till standardrutiner och bruksanvisningar för utrustning på verkstadsgolvet.
En sökfunktion för policyer som förblir korrekt även när dokumenten ändras.
Sökning efter läroplaner och kursmaterial i ett innehållsbibliotek.
Sökning efter förordningar och riktlinjer med fullständig spårbarhet till källan.
Vad händer härnäst?
Omrankning och hybridsökning (nyckelord + vektor) – den nuvarande standarden i produktionsmiljön för ytterligare förbättringar av träffsäkerheten.
Ett större och mer heterogent intagskorpus för att på nytt testa borttagningen av kontextuell berikning.
Genomförande av behörighetskontroll vid hämtningstidpunkten, vilket åtgärdar en potentiell brist i åtkomstkontrollen som identifierades under konstruktionsgranskningen.
OCR-inläsning av skannade och bildbaserade dokument, redan anpassad för användningsfall med personaldokument.
Replikering av infrastrukturen för iscensättning och produktion, som medvetet planerats att ske efter detta test.
Varje påstående stöds av en verklig, reproducerbar pipelinekörning och oberoende verifierade sökfrågor.
Om författaren
Koncern-VD och arkitekt för AI-lösningar för företag, Carmatec
Aromal är en teknikentreprenör och AI-arkitekt för företag med mer än 25 års erfarenhet inom mjukvaruutveckling, molninfrastruktur, drift av datacenter och affärstransformation. Som koncern-VD är han aktivt delaktig i utformningen av de AI-plattformar för företag, multiagent-system och kunskapsdrivna applikationer som han leder Carmatec i utvecklingen av – inklusive de RAG- och företagskunskapssystem som denna benchmarkrapport handlar om. Hans nuvarande tekniska fokus spänner över Retrieval-Augmented Generation, agentorkestrering, integrationer av Model Context Protocol samt AI-styrning och produktionsberedskap.