OpenAI
Chat Completions, embeddings, bilder, ljud och filer, oförändrade.
/v1/chat/completionsOmniRoute / API-yta
Chatt, embeddings, omrankning, bilder, video, musik, tal, OCR, filer och batchar, i det anropsformat din klient redan talar.
Wire-format
En process tar emot flera format, så ett verktyg byggt mot en leverantörs SDK behöver bara en ny bas-URL och inget mer.
Chat Completions, embeddings, bilder, ljud och filer, oförändrade.
/v1/chat/completionsMessages-formatet, inklusive tokenräkning.
/v1/messagesResponses API-formatet, med kompaktering av verktygsutdata.
/v1/responsesgenerateContent och Gemini-modellistan.
/v1beta/modelsDrop-in för verktyg som talar det lokala Ollama-API:et.
/v1/api/chatCohere/Voyage-omrankning plus Jina classify och segment.
/v1/rerankEndpoints
Grupperade efter vad du försöker göra snarare än vilken leverantör som råkar betjäna det.
Tre anropsformat når samma router, så en klient behåller det format den redan talar.
/v1/chat/completionsOpenAI Chat Completions, strömmande eller buffrat/v1/messagesAnthropic Messages/v1/responsesOpenAI Responses/v1/messages/count_tokensRäkna tokens innan du spenderar demRetrieval-halvan av en RAG-stack bakom samma endpoint och samma nyckel.
/v1/embeddingsText- och multimodala embeddings/v1/rerankCohere- och Voyage-kompatibel omrankning/v1/searchWebbsöksabstraktion över leverantörer/v1/classifyJina-textklassificering/v1/segmentJina-innehållssegmentering/v1/web/fetchLäsbar sidextraktionGenerering routas genom samma fallback och kostnadsredovisning som text.
/v1/images/generationsBildsyntes/v1/images/editsRedigering och inpainting/v1/videos/generationsVideogenerering/v1/music/generationsMusiksyntesTal i båda riktningarna, plus OCR för skannat källmaterial.
/v1/audio/transcriptionsTal till text/v1/audio/translationsÖversättande transkribering/v1/audio/speechText till tal/v1/ocrDokument-OCRLadda upp en gång och kör sedan arbetet asynkront istället för att hålla en anslutning öppen.
/v1/filesLadda upp en fil/v1/files/{id}/contentStrömma tillbaka filinnehåll/v1/batchesSkapa ett batchjobb/v1/batches/{id}Polla batchstatus/v1/batches/{id}/cancelAvbryt en pågående batchAllt en klient behöver för att välja modell och hålla sig inom budget.
/v1/modelsModellkatalog grupperad per leverantör/v1/quotas/checkFörvalidera återstående kvot/v1/moderationsInnehållsmoderering/v1/wsWebSocket-uppgradering för strömmande klienterEn MCP-server med 110 verktyg och ett A2A-agentkort, serverade av samma process.
/api/mcp/streamMCP över HTTP, 33 scope/api/mcp/sseMCP över Server-Sent Events/a2aJSON-RPC 2.0, 6 agent-skills/.well-known/agent.jsonPublikt agentkortHeaders
Routingen är ingen svart låda: beslutet, kostnaden och komprimeringen som gav ett svar följer alla med tillbaka.
X-OmniRoute-DecisionStrategi, leverantörsalias och latens som betjänade anropetX-OmniRoute-ProviderLeverantörsaliaset anropet faktiskt routades tillX-OmniRoute-ModelDen upplösta modellidentifierarenX-OmniRoute-Latency-MsUppströmslatens i millisekunderX-OmniRoute-Tokens-InAntal input-tokensX-OmniRoute-Tokens-OutAntal output-tokensX-OmniRoute-Response-CostKostnad i USD för det här svaretX-OmniRoute-Cost-SavedUSD som undveks vid en cacheträffX-OmniRoute-CacheHIT eller MISS på icke-strömmande anropX-OmniRoute-CompressionTillämpat komprimeringsläge och var det kom ifrånX-OmniRoute-Fallback-AttemptsAntal fallback-hopp, när det förekom någraX-OmniRoute-Request-IdKorrelations-id för anropsloggenx-omniroute-compressionÅsidosätt komprimeringsprofilen för ett anropX-OmniRoute-No-CacheGå förbi den semantiska cachenx-omniroute-no-memoryHoppa över injektion av minne och skillsX-Session-IdNyckel för sessionsaffinitet och kostnadsattribueringIdempotency-KeyDeduplicera ett omförsökt anrop