Leitfaden zur RAG- und Vektorsuche
Erstellen Sie eine blitzschnelle semantische Suche und ein umfassendes Retrieval-Augmented Generation (RAG)-System, das PostgreSQL pgvector und das einheitliche KI-Gateway von Aurabase kombiniert.
RAG auf Aurabase in 3 Schritten
Mit RAG können Ihre KI-Modelle ohne Umschulung präzise auf Ihre eigenen privaten Daten reagieren:
- Vektorisierung: Ihre Textdokumente werden mit
aura.ai.embed()in digitale Vektoren umgewandelt. - Speicherung und Indizierung: Vektoren werden in PostgreSQL mit der nativen Erweiterung
pgvectorgespeichert. - Augmentation & Antwort: Die Frage wird mit den gespeicherten Vektoren verglichen und die relevanten Snippets werden dem LLM über
aura.ai.chat()bereitgestellt.
Vollständiger RAG-Pipeline-Code
HNSW-Indizierung für Abfragen unter 10 ms
Für Datenbanken, die Hunderttausende von Vektoren enthalten, bietet die HNSW-Indizierung (Hierarchical Navigable Small World) eine deutlich bessere Suchleistung als ivfflat:
HNSW-Index (empfohlen)
Keine Zeit vor dem Training, Rückruf > 99 % und konstante Latenz auch bei kontinuierlichem Einfügen neuer Dokumente.
Kosinusabstand (<=>)
Verwenden Sie den Operator <=>, um den normalisierten Kosinusabstand zwischen den Einbettungsvektoren zu berechnen.
Semantischer Cache und Token-Einsparungen
Das AI Gateway von Aurabase integriert einen automatischen semantischen Cache: Wenn zwei Benutzer eine ähnliche Frage stellen (Kosinusähnlichkeit größer als 0,95), wird die Antwort in weniger als 2 ms aus dem In-Memory-Cache bereitgestellt, wodurch 100 % der LLM-Anrufkosten eingespart werden.