AI Gateway
Proxy unifié OpenAI, Anthropic, Google Gemini. Cache sémantique, budget per-tenant, observabilité tokens. Un seul SDK pour vos workloads LLM.
Un endpoint, N providers
L'AI Gateway est une surface HTTP/SDK unique qui proxifie les providers LLM majeurs. Le même code tourne contre OpenAI, Anthropic, Mistral ou Vertex AI — vous changez seulement provider.
Le gateway ajoute trois couches au-dessus : cache sémantique (embeddings des prompts, hit rate ~30% en moyenne), budget per-tenant (quota $ par user), observabilité (tokens, coût, latence, provider).
Cinq supportés GA
~30% des prompts déjà connus
Pour chaque requête entrante, le gateway embedding la question (modèle léger interne, <10ms) et cherche en vecteur similaire dans un cache TTL. Si la distance cosinus dépasse votre seuil (par défaut 0.96), il retourne la réponse cachée sans appeler le provider.
cache.scope: 'user' si vous voulez isoler par utilisateur.Chat, embeddings, RAG
Quotas par user, métriques live
Chaque appel est loggué avec tokens in/out, coût calculé au centième de centime, provider, model, latence, cache hit. Définissez un budget mensuel par user pour éviter les surprises.
reset_at. Votre app peut gérer ça gracieusement (dégrader vers un modèle moins cher, prompter l'utilisateur à upgrader).