Aurabase Logo
aurabasedocs
docsGuidesRAG & pgvector

Guide RAG & Recherche Vectorielle

Construisez une recherche sémantique ultra-rapide et un système RAG (Retrieval-Augmented Generation) complet combinant PostgreSQL pgvector et l'AI Gateway unifiée d'Aurabase.

12 min de lecture·Niveau avancé·Révisé le 19 août 2026
#
Architecture

Le RAG sur Aurabase en 3 étapes

Le RAG permet à vos modèles d'intelligence artificielle de répondre avec précision sur vos propres données privées sans réentraînement :

  • Vectorisation : Vos documents textuels sont transformés en vecteurs numériques grâce à aura.ai.embed().
  • Stockage & Indexation : Les vecteurs sont enregistrés dans PostgreSQL avec l'extension native pgvector.
  • Augmentation & Réponse : La question est comparée aux vecteurs stockés, et les extraits pertinents sont fournis au LLM via aura.ai.chat().
#
Implémentation

Code complet du Pipeline RAG

src/lib/index-doc.tsTYPESCRIPT
import { aura } from '@/lib/aurabase'
export async function indexDocument(content: string, metadata: Record<string, any>) {
// Calcul de l embedding vectoriel via l AI Gateway Aurabase
const { vectors } = await aura.ai.embed({
provider: 'openai',
model: 'text-embedding-3-small',
input: [content],
})
// Sauvegarde dans la table PostgreSQL
const { data, error } = await aura.from('documents').insert({
content,
metadata,
embedding: vectors[0],
})
return { data, error }
}
#
Performance

Indexation HNSW pour des requêtes sub-10ms

Pour les bases de données contenant des centaines de milliers de vecteurs, l'indexation HNSW (Hierarchical Navigable Small World) offre des performances de recherche considérablement supérieures à ivfflat :

HNSW Index (Recommandé)

Zéro temps d’entraînement préalable, rappel > 99% et latence constante même en cas d’insertions continues de nouveaux documents.

Distance Cosinus (<=>)

Utilisez l'opérateur <=> pour calculer la distance cosinus normalisée entre les vecteurs d'embeddings.

#
Optimisation

Cache Sémantique & Économies de Tokens

L'AI Gateway d'Aurabase intègre un cache sémantique automatique : si deux utilisateurs posent une question similaire (similarité cosinus supérieure à 0.95), la réponse est servie depuis le cache en mémoire en moins de 2 ms, économisant 100% du coût de l'appel LLM.

Dernière mise à jour · 19 août 2026