Guia de pesquisa RAG e vetorial
Crie uma pesquisa semântica extremamente rápida e um sistema abrangente de geração aumentada de recuperação (RAG) combinando o pgvector PostgreSQL e o gateway de IA unificado da Aurabase.
RAG no Aurabase em 3 etapas
O RAG permite que seus modelos de IA respondam com precisão aos seus próprios dados privados sem retreinamento:
- Vetorização: Seus documentos textuais são transformados em vetores digitais usando
aura.ai.embed(). - Armazenamento e Indexação: Os vetores são armazenados no PostgreSQL com a extensão nativa
pgvector. - Aumento e resposta: A pergunta é comparada aos vetores armazenados e os trechos relevantes são fornecidos ao LLM por meio de
aura.ai.chat().
Código completo do pipeline RAG
Indexação HNSW para consultas abaixo de 10ms
Para bancos de dados contendo centenas de milhares de vetores, a indexação HNSW (Hierarchical Navigable Small World) fornece desempenho de pesquisa significativamente melhor do que ivfflat:
Índice HNSW (recomendado)
Tempo zero de pré-treinamento, recall > 99% e latência constante mesmo com inserções contínuas de novos documentos.
Distância do cosseno (<=>)
Use o operador <=> para calcular a distância cosseno normalizada entre os vetores de incorporação.
Cache Semântico e Economia de Token
O AI Gateway da Aurabase integra um cache semântico automático : se dois usuários fizerem uma pergunta semelhante (semelhança de cosseno maior que 0,95), a resposta será servida a partir do cache na memória em menos de 2 ms, economizando 100% do custo da chamada LLM.