RAG & Vector-zoekgids
Bouw een razendsnel semantisch zoek- en uitgebreid Retrieval-Augmented Generation (RAG)-systeem dat PostgreSQL pgvector en de uniforme AI-gateway van Aurabase combineert.
RAG op Aurabase in 3 stappen
Met RAG kunnen uw AI-modellen accuraat reageren op uw eigen privégegevens zonder dat u deze opnieuw hoeft te trainen:
- Vectorisatie: Uw tekstdocumenten worden omgezet in digitale vectoren met behulp van
aura.ai.embed(). - Opslag en indexering: vectoren worden opgeslagen in PostgreSQL met de native extensie
pgvector. - Augmentatie en antwoord: De vraag wordt vergeleken met de opgeslagen vectoren en de relevante fragmenten worden via
aura.ai.chat()aan de LLM verstrekt.
Volledige RAG-pijplijncode
HNSW-indexering voor zoekopdrachten van minder dan 10 ms
Voor databases die honderdduizenden vectoren bevatten, biedt HNSW (Hierarchical Navigable Small World) indexering aanzienlijk betere zoekprestaties dan ivfflat:
HNSW-index (aanbevolen)
Geen pre-trainingstijd, herinnering > 99% en constante latentie, zelfs bij het voortdurend invoegen van nieuwe documenten.
Cosinusafstand (<=>)
Gebruik de operator <=> om de genormaliseerde cosinusafstand tussen de inbeddingsvectoren te berekenen.
Semantische cache- en tokenbesparingen
De AI Gateway van Aurabase integreert een automatische semantische cache: als twee gebruikers een vergelijkbare vraag stellen (cosinusgelijkenis groter dan 0,95), wordt het antwoord geserveerd vanuit de in-memory cache in in minder dan 2 ms, waardoor 100% van de LLM-gesprekskosten wordt bespaard.