Aura Logo
aurabasedocumentos
documentos›Guias›RAG & pgvetor

Guia de pesquisa RAG e vetorial

Crie uma pesquisa semântica extremamente rápida e um sistema abrangente de geração aumentada de recuperação (RAG) combinando o pgvector PostgreSQL e o gateway de IA unificado da Aurabase.

12 min lido·Nível avançado·Revisado em 19 de ago. de 2026
Este texto em inglês foi gerado automaticamente a partir do original em francês e ainda não foi revisado.
Esta página foi traduzida automaticamente. A versão em inglês é oficial.
#
Arquitetura

RAG no Aurabase em 3 etapas

O RAG permite que seus modelos de IA respondam com precisão aos seus próprios dados privados sem retreinamento:

  • Vetorização: Seus documentos textuais são transformados em vetores digitais usando aura.ai.embed().
  • Armazenamento e Indexação: Os vetores são armazenados no PostgreSQL com a extensão nativa pgvector.
  • Aumento e resposta: A pergunta é comparada aos vetores armazenados e os trechos relevantes são fornecidos ao LLM por meio de aura.ai.chat().
#
Implementação

Código completo do pipeline RAG

src/lib/index-doc.tstypescript
import { aura } from '@/lib/aurabase'

export async function indexDocument(content: string, metadata: Record<string, any>) {
  // Cálculo de incorporação de vetores por meio do AI Gateway Aurabase
  const { vectors } = await aura.ai.embed({
    provider: 'openai',
    model: 'text-embedding-3-small',
    input: [content],
  })

  // Salvando na tabela PostgreSQL
  const { data, error } = await aura.from('documents').insert({
    content,
    metadata,
    embedding: vectors[0],
  })
  return { data, error }
}
#
Desempenho

Indexação HNSW para consultas abaixo de 10ms

Para bancos de dados contendo centenas de milhares de vetores, a indexação HNSW (Hierarchical Navigable Small World) fornece desempenho de pesquisa significativamente melhor do que ivfflat:

Índice HNSW (recomendado)

Tempo zero de pré-treinamento, recall > 99% e latência constante mesmo com inserções contínuas de novos documentos.

Distância do cosseno (<=>)

Use o operador <=> para calcular a distância cosseno normalizada entre os vetores de incorporação.

#
Otimização

Cache Semântico e Economia de Token

O AI Gateway da Aurabase integra um cache semântico automático : se dois usuários fizerem uma pergunta semelhante (semelhança de cosseno maior que 0,95), a resposta será servida a partir do cache na memória em menos de 2 ms, economizando 100% do custo da chamada LLM.

Última atualização · 19 de ago. de 2026