OpenAI
Chat Completions, embeddings, billeder, lyd og filer, uændret.
/v1/chat/completionsOmniRoute / API-flade
Chat, embeddings, reranking, billeder, video, musik, tale, OCR, filer og batches, i det request-format din klient allerede taler.
Wireformater
Én proces accepterer flere formater, så et værktøj bygget mod én leverandørs SDK kun behøver en ny base-URL og intet andet.
Chat Completions, embeddings, billeder, lyd og filer, uændret.
/v1/chat/completionsMessages-wireformatet, inklusive tokenoptælling.
/v1/messagesResponses API-formatet, med komprimering af værktøjsoutput.
/v1/responsesgenerateContent og Gemini-modellisten.
/v1beta/modelsDrop-in til værktøjer, der taler den lokale Ollama API.
/v1/api/chatCohere/Voyage-reranking plus Jina classify og segment.
/v1/rerankEndpoints
Grupperet efter, hvad du prøver at gøre, frem for hvilken udbyder der tilfældigvis leverer det.
Tre request-formater rammer den samme router, så en klient beholder det format, den allerede taler.
/v1/chat/completionsOpenAI Chat Completions, streaming eller bufret/v1/messagesAnthropic Messages/v1/responsesOpenAI Responses/v1/messages/count_tokensTæl tokens, før du bruger demRetrieval-halvdelen af en RAG-stack bag samme endpoint og samme nøgle.
/v1/embeddingsTekst- og multimodale embeddings/v1/rerankCohere- og Voyage-kompatibel reranking/v1/searchWebsøgningsabstraktion på tværs af udbydere/v1/classifyJina-tekstklassificering/v1/segmentJina-indholdssegmentering/v1/web/fetchUdtræk af læsbare siderGenerering routes gennem samme fallback og omkostningsregnskab som tekst.
/v1/images/generationsBilledsyntese/v1/images/editsRedigering og inpainting/v1/videos/generationsVideogenerering/v1/music/generationsMusiksynteseTale i begge retninger, plus OCR til scannet kildemateriale.
/v1/audio/transcriptionsTale til tekst/v1/audio/translationsOversættende transskription/v1/audio/speechTekst til tale/v1/ocrDokument-OCRUpload én gang, og kør arbejdet asynkront i stedet for at holde en forbindelse åben.
/v1/filesUpload en fil/v1/files/{id}/contentStream filindhold tilbage/v1/batchesOpret et batchjob/v1/batches/{id}Poll batchstatus/v1/batches/{id}/cancelAfbryd en kørende batchAlt, hvad en klient skal bruge for at vælge en model og holde sig inden for et budget.
/v1/modelsModelkatalog grupperet efter udbyder/v1/quotas/checkForhåndsvalidér resterende kvote/v1/moderationsIndholdsmoderation/v1/wsWebSocket-opgradering til streaming-klienterEn MCP-server med 110 værktøjer og et A2A-agentkort, serveret af samme proces.
/api/mcp/streamMCP over HTTP, 33 scopes/api/mcp/sseMCP over Server-Sent Events/a2aJSON-RPC 2.0, 6 agent-skills/.well-known/agent.jsonOffentligt agentkortHeaders
Routing er ikke en sort boks: beslutningen, omkostningen og komprimeringen bag et svar følger alle med tilbage.
X-OmniRoute-DecisionStrategi, udbyderalias og latenstid, der betjente requestenX-OmniRoute-ProviderDet udbyderalias, der faktisk blev routet tilX-OmniRoute-ModelDen opløste modelidentifikatorX-OmniRoute-Latency-MsUpstream-latenstid i millisekunderX-OmniRoute-Tokens-InAntal input-tokensX-OmniRoute-Tokens-OutAntal output-tokensX-OmniRoute-Response-CostOmkostning i USD for dette svarX-OmniRoute-Cost-SavedUSD undgået ved et cache-hitX-OmniRoute-CacheHIT eller MISS på ikke-streamende requestsX-OmniRoute-CompressionAnvendt komprimeringstilstand, og hvor den kom fraX-OmniRoute-Fallback-AttemptsUdførte fallback-hop, når der var nogenX-OmniRoute-Request-IdKorrelations-id til request-loggenx-omniroute-compressionOverstyr komprimeringsprofilen for én requestX-OmniRoute-No-CacheSpring den semantiske cache overx-omniroute-no-memorySpring hukommelses- og skills-injektion overX-Session-IdNøgle til sessionsaffinitet og omkostningsfordelingIdempotency-KeyDeduplikér en gentaget request