OpenAI
Chat Completions, embeddings, images, audio et fichiers, sans changement.
/v1/chat/completionsOmniRoute / Surface API
Chat, embeddings, reranking, images, vidéo, musique, parole, OCR, fichiers et lots, dans le format de requête que votre client parle déjà.
Formats de requête
Un seul processus accepte plusieurs formats, donc un outil conçu pour le SDK d'un éditeur n'a besoin que d'un changement d'URL de base.
Chat Completions, embeddings, images, audio et fichiers, sans changement.
/v1/chat/completionsLe format Messages, y compris le comptage de tokens.
/v1/messagesLe format de la Responses API, avec compaction de la sortie des outils.
/v1/responsesgenerateContent et la liste des modèles Gemini.
/v1beta/modelsRemplacement direct pour les outils qui parlent l'API locale Ollama.
/v1/api/chatReranking Cohere/Voyage plus classification et segmentation Jina.
/v1/rerankEndpoints
Groupés selon ce que vous cherchez à faire plutôt que selon le fournisseur qui le sert.
Trois formats de requête atteignent le même routeur, donc un client garde le format qu'il parle déjà.
/v1/chat/completionsOpenAI Chat Completions, en streaming ou en bloc/v1/messagesAnthropic Messages/v1/responsesOpenAI Responses/v1/messages/count_tokensComptez les tokens avant de les dépenserLa moitié récupération d'une stack RAG derrière le même endpoint et la même clé.
/v1/embeddingsEmbeddings texte et multimodaux/v1/rerankReranking compatible Cohere et Voyage/v1/searchAbstraction de recherche web multi-fournisseurs/v1/classifyClassification de texte Jina/v1/segmentSegmentation de contenu Jina/v1/web/fetchExtraction de page lisibleLa génération passe par le même repli et la même comptabilité des coûts que le texte.
/v1/images/generationsSynthèse d'images/v1/images/editsÉdition et inpainting/v1/videos/generationsGénération de vidéo/v1/music/generationsSynthèse musicaleParole dans les deux sens, plus OCR pour les documents scannés.
/v1/audio/transcriptionsParole vers texte/v1/audio/translationsTranscription avec traduction/v1/audio/speechTexte vers parole/v1/ocrOCR de documentsTéléversez une fois, puis exécutez le travail de façon asynchrone au lieu de garder une connexion ouverte.
/v1/filesTéléverser un fichier/v1/files/{id}/contentRécupérer le contenu d'un fichier en flux/v1/batchesCréer un traitement par lot/v1/batches/{id}Interroger l'état d'un lot/v1/batches/{id}/cancelAnnuler un lot en coursTout ce dont un client a besoin pour choisir un modèle et rester dans un budget.
/v1/modelsCatalogue de modèles groupé par fournisseur/v1/quotas/checkPré-valider le quota restant/v1/moderationsModération de contenu/v1/wsUpgrade WebSocket pour les clients en streamingUn serveur MCP avec 110 outils et une agent card A2A, servis par le même processus.
/api/mcp/streamMCP sur HTTP, 33 périmètres/api/mcp/sseMCP sur Server-Sent Events/a2aJSON-RPC 2.0, 6 compétences d'agent/.well-known/agent.jsonAgent card publiqueEn-têtes
Le routage n'est pas une boîte noire : la décision, le coût et la compression à l'origine d'une réponse voyagent avec elle.
X-OmniRoute-DecisionStratégie, alias de fournisseur et latence qui ont servi la requêteX-OmniRoute-ProviderL'alias du fournisseur réellement utiliséX-OmniRoute-ModelL'identifiant du modèle résoluX-OmniRoute-Latency-MsLatence amont en millisecondesX-OmniRoute-Tokens-InNombre de tokens en entréeX-OmniRoute-Tokens-OutNombre de tokens en sortieX-OmniRoute-Response-CostCoût en USD de cette réponseX-OmniRoute-Cost-SavedUSD évités sur un hit du cacheX-OmniRoute-CacheHIT ou MISS sur les requêtes sans streamingX-OmniRoute-CompressionMode de compression appliqué et son origineX-OmniRoute-Fallback-AttemptsSauts de repli effectués, s'il y en a euX-OmniRoute-Request-IdIdentifiant de corrélation pour le journal des requêtesx-omniroute-compressionRemplacer le profil de compression pour une requêteX-OmniRoute-No-CacheContourner le cache sémantiquex-omniroute-no-memoryIgnorer l'injection de mémoire et de compétencesX-Session-IdClé d'affinité de session et d'attribution des coûtsIdempotency-KeyDédupliquer une requête relancée