OpenAI
Chat Completions, embeddings, imagens, áudio e arquivos, sem alterações.
/v1/chat/completionsOmniRoute / Superfície da API
Chat, embeddings, reranking, imagens, vídeo, música, fala, OCR, arquivos e lotes, no formato de requisição que seu cliente já usa.
Formatos de requisição
Um processo aceita vários formatos, então uma ferramenta feita para o SDK de um fornecedor só precisa trocar a URL base e nada mais.
Chat Completions, embeddings, imagens, áudio e arquivos, sem alterações.
/v1/chat/completionsO formato Messages, incluindo contagem de tokens.
/v1/messagesO formato da Responses API, com compactação de saída de ferramentas.
/v1/responsesgenerateContent e a listagem de modelos do Gemini.
/v1beta/modelsSubstituto direto para ferramentas que falam a API local do Ollama.
/v1/api/chatReranking Cohere/Voyage mais classify e segment da Jina.
/v1/rerankEndpoints
Agrupados pelo que você quer fazer, e não pelo provedor que por acaso atende.
Três formatos de requisição chegam ao mesmo roteador, então o cliente mantém o formato que já usa.
/v1/chat/completionsOpenAI Chat Completions, em streaming ou bufferizado/v1/messagesAnthropic Messages/v1/responsesOpenAI Responses/v1/messages/count_tokensConte tokens antes de gastá-losA metade de recuperação de uma stack RAG atrás do mesmo endpoint e da mesma chave.
/v1/embeddingsEmbeddings de texto e multimodais/v1/rerankReranking compatível com Cohere e Voyage/v1/searchAbstração de busca web entre provedores/v1/classifyClassificação de texto da Jina/v1/segmentSegmentação de conteúdo da Jina/v1/web/fetchExtração de página legívelA geração passa pelo mesmo fallback e pela mesma contabilidade de custos que o texto.
/v1/images/generationsSíntese de imagens/v1/images/editsEdição e inpainting/v1/videos/generationsGeração de vídeo/v1/music/generationsSíntese de músicaFala nos dois sentidos, mais OCR para material digitalizado.
/v1/audio/transcriptionsFala para texto/v1/audio/translationsTranscrição com tradução/v1/audio/speechTexto para fala/v1/ocrOCR de documentosEnvie uma vez e execute o trabalho de forma assíncrona em vez de manter uma conexão aberta.
/v1/filesEnviar um arquivo/v1/files/{id}/contentTransmitir o conteúdo do arquivo de volta/v1/batchesCriar um job em lote/v1/batches/{id}Consultar o status do lote/v1/batches/{id}/cancelCancelar um lote em execuçãoTudo que um cliente precisa para escolher um modelo e ficar dentro do orçamento.
/v1/modelsCatálogo de modelos agrupado por provedor/v1/quotas/checkPré-validar a cota restante/v1/moderationsModeração de conteúdo/v1/wsUpgrade para WebSocket em clientes de streamingUm servidor MCP com 110 ferramentas e um agent card A2A, servidos pelo mesmo processo.
/api/mcp/streamMCP via HTTP, 33 escopos/api/mcp/sseMCP via Server-Sent Events/a2aJSON-RPC 2.0, 6 skills de agente/.well-known/agent.jsonAgent card públicoHeaders
O roteamento não é uma caixa-preta: a decisão, o custo e a compressão que produziram uma resposta voltam junto com ela.
X-OmniRoute-DecisionEstratégia, alias do provedor e latência que atenderam a requisiçãoX-OmniRoute-ProviderO alias do provedor para o qual a requisição foi roteadaX-OmniRoute-ModelO identificador do modelo resolvidoX-OmniRoute-Latency-MsLatência upstream em milissegundosX-OmniRoute-Tokens-InContagem de tokens de entradaX-OmniRoute-Tokens-OutContagem de tokens de saídaX-OmniRoute-Response-CostCusto em USD desta respostaX-OmniRoute-Cost-SavedUSD evitados em um acerto de cacheX-OmniRoute-CacheHIT ou MISS em requisições sem streamingX-OmniRoute-CompressionModo de compressão aplicado e de onde veioX-OmniRoute-Fallback-AttemptsSaltos de fallback realizados, quando houveX-OmniRoute-Request-IdId de correlação para o log de requisiçõesx-omniroute-compressionSobrescreva o perfil de compressão em uma requisiçãoX-OmniRoute-No-CacheIgnore o cache semânticox-omniroute-no-memoryPule a injeção de memória e skillsX-Session-IdChave de afinidade de sessão e atribuição de custosIdempotency-KeyDeduplique uma requisição repetida