OpenAI
Chat Completions, embeddings, imagens, áudio e ficheiros, sem alterações.
/v1/chat/completionsOmniRoute / Superfície da API
Chat, embeddings, reranking, imagens, vídeo, música, fala, OCR, ficheiros e lotes, no formato de pedido que o seu cliente já fala.
Formatos de transporte
Um processo aceita vários formatos, por isso uma ferramenta construída sobre o SDK de um fornecedor só precisa de mudar o URL base e nada mais.
Chat Completions, embeddings, imagens, áudio e ficheiros, sem alterações.
/v1/chat/completionsO formato Messages, incluindo contagem de tokens.
/v1/messagesO formato da Responses API, com compactação da saída de ferramentas.
/v1/responsesgenerateContent e a listagem de modelos Gemini.
/v1beta/modelsSubstituto direto para ferramentas que falam a API local do Ollama.
/v1/api/chatReranking Cohere/Voyage mais classificação e segmentação Jina.
/v1/rerankEndpoints
Agrupados pelo que está a tentar fazer e não pelo fornecedor que por acaso o serve.
Três formatos de pedido chegam ao mesmo router, para que o cliente mantenha o formato que já fala.
/v1/chat/completionsOpenAI Chat Completions, em streaming ou buffered/v1/messagesAnthropic Messages/v1/responsesOpenAI Responses/v1/messages/count_tokensConte os tokens antes de os gastarA metade de recuperação de uma stack RAG atrás do mesmo endpoint e da mesma chave.
/v1/embeddingsEmbeddings de texto e multimodais/v1/rerankReranking compatível com Cohere e Voyage/v1/searchAbstração de pesquisa web entre fornecedores/v1/classifyClassificação de texto Jina/v1/segmentSegmentação de conteúdo Jina/v1/web/fetchExtração legível de páginasA geração passa pelo mesmo fallback e contabilidade de custos que o texto.
/v1/images/generationsSíntese de imagens/v1/images/editsEdição e inpainting/v1/videos/generationsGeração de vídeo/v1/music/generationsSíntese de músicaFala em ambas as direções, mais OCR para material digitalizado.
/v1/audio/transcriptionsFala para texto/v1/audio/translationsTranscrição com tradução/v1/audio/speechTexto para fala/v1/ocrOCR de documentosCarregue uma vez e depois execute o trabalho de forma assíncrona em vez de manter uma ligação aberta.
/v1/filesCarregar um ficheiro/v1/files/{id}/contentDevolver o conteúdo do ficheiro em stream/v1/batchesCriar um trabalho em lote/v1/batches/{id}Consultar o estado do lote/v1/batches/{id}/cancelCancelar um lote em execuçãoTudo o que um cliente precisa para escolher um modelo e manter-se dentro do orçamento.
/v1/modelsCatálogo de modelos agrupado por fornecedor/v1/quotas/checkPré-validar a quota restante/v1/moderationsModeração de conteúdo/v1/wsUpgrade WebSocket para clientes em streamingUm servidor MCP com 110 ferramentas e um agent card A2A, servidos pelo mesmo processo.
/api/mcp/streamMCP sobre HTTP, 33 âmbitos/api/mcp/sseMCP sobre Server-Sent Events/a2aJSON-RPC 2.0, 6 skills de agente/.well-known/agent.jsonAgent card públicoCabeçalhos
O encaminhamento não é uma caixa negra: a decisão, o custo e a compressão que produziram uma resposta viajam todos com ela.
X-OmniRoute-DecisionEstratégia, alias do fornecedor e latência que serviram o pedidoX-OmniRoute-ProviderO alias do fornecedor para onde foi realmente encaminhadoX-OmniRoute-ModelO identificador do modelo resolvidoX-OmniRoute-Latency-MsLatência upstream em milissegundosX-OmniRoute-Tokens-InContagem de tokens de entradaX-OmniRoute-Tokens-OutContagem de tokens de saídaX-OmniRoute-Response-CostCusto desta resposta em USDX-OmniRoute-Cost-SavedUSD evitados num acerto de cacheX-OmniRoute-CacheHIT ou MISS em pedidos sem streamingX-OmniRoute-CompressionModo de compressão aplicado e a sua origemX-OmniRoute-Fallback-AttemptsSaltos de fallback efetuados, quando os houveX-OmniRoute-Request-IdId de correlação para o registo de pedidosx-omniroute-compressionSubstituir o perfil de compressão num único pedidoX-OmniRoute-No-CacheContornar a cache semânticax-omniroute-no-memorySaltar a injeção de memória e skillsX-Session-IdChave de afinidade de sessão e atribuição de custosIdempotency-KeyDesduplicar um pedido repetido