OmniRoute / Superfície da API

Um endpoint, mais do que chat.

Chat, embeddings, reranking, imagens, vídeo, música, fala, OCR, ficheiros e lotes, no formato de pedido que o seu cliente já fala.

Formatos de transporte

Mantenha o formato de pedido que o seu cliente já envia.

Um processo aceita vários formatos, por isso uma ferramenta construída sobre o SDK de um fornecedor só precisa de mudar o URL base e nada mais.

OpenAI

Chat Completions, embeddings, imagens, áudio e ficheiros, sem alterações.

/v1/chat/completions

Anthropic

O formato Messages, incluindo contagem de tokens.

/v1/messages

OpenAI Responses

O formato da Responses API, com compactação da saída de ferramentas.

/v1/responses

Gemini

generateContent e a listagem de modelos Gemini.

/v1beta/models

Ollama

Substituto direto para ferramentas que falam a API local do Ollama.

/v1/api/chat

Rerank and Jina

Reranking Cohere/Voyage mais classificação e segmentação Jina.

/v1/rerank

Endpoints

Mais do que chat completions.

Agrupados pelo que está a tentar fazer e não pelo fornecedor que por acaso o serve.

Chat e mensagens

Três formatos de pedido chegam ao mesmo router, para que o cliente mantenha o formato que já fala.

  • POST/v1/chat/completionsOpenAI Chat Completions, em streaming ou buffered
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokensConte os tokens antes de os gastar

Embeddings, pesquisa e ranking

A metade de recuperação de uma stack RAG atrás do mesmo endpoint e da mesma chave.

  • POST/v1/embeddingsEmbeddings de texto e multimodais
  • POST/v1/rerankReranking compatível com Cohere e Voyage
  • POST/v1/searchAbstração de pesquisa web entre fornecedores
  • POST/v1/classifyClassificação de texto Jina
  • POST/v1/segmentSegmentação de conteúdo Jina
  • POST/v1/web/fetchExtração legível de páginas

Imagem, vídeo e música

A geração passa pelo mesmo fallback e contabilidade de custos que o texto.

  • POST/v1/images/generationsSíntese de imagens
  • POST/v1/images/editsEdição e inpainting
  • POST/v1/videos/generationsGeração de vídeo
  • POST/v1/music/generationsSíntese de música

Áudio e documentos

Fala em ambas as direções, mais OCR para material digitalizado.

  • POST/v1/audio/transcriptionsFala para texto
  • POST/v1/audio/translationsTranscrição com tradução
  • POST/v1/audio/speechTexto para fala
  • POST/v1/ocrOCR de documentos

Ficheiros e lotes

Carregue uma vez e depois execute o trabalho de forma assíncrona em vez de manter uma ligação aberta.

  • POST/v1/filesCarregar um ficheiro
  • GET/v1/files/{id}/contentDevolver o conteúdo do ficheiro em stream
  • POST/v1/batchesCriar um trabalho em lote
  • GET/v1/batches/{id}Consultar o estado do lote
  • POST/v1/batches/{id}/cancelCancelar um lote em execução

Descoberta e controlo

Tudo o que um cliente precisa para escolher um modelo e manter-se dentro do orçamento.

  • GET/v1/modelsCatálogo de modelos agrupado por fornecedor
  • GET/v1/quotas/checkPré-validar a quota restante
  • POST/v1/moderationsModeração de conteúdo
  • GET/v1/wsUpgrade WebSocket para clientes em streaming

Protocolos de agentes

Um servidor MCP com 110 ferramentas e um agent card A2A, servidos pelo mesmo processo.

  • GET/api/mcp/streamMCP sobre HTTP, 33 âmbitos
  • GET/api/mcp/sseMCP sobre Server-Sent Events
  • POST/a2aJSON-RPC 2.0, 6 skills de agente
  • GET/.well-known/agent.jsonAgent card público

Cabeçalhos

Cada resposta diz como foi servida.

O encaminhamento não é uma caixa negra: a decisão, o custo e a compressão que produziram uma resposta viajam todos com ela.

Cabeçalhos de resposta

  • X-OmniRoute-DecisionEstratégia, alias do fornecedor e latência que serviram o pedido
  • X-OmniRoute-ProviderO alias do fornecedor para onde foi realmente encaminhado
  • X-OmniRoute-ModelO identificador do modelo resolvido
  • X-OmniRoute-Latency-MsLatência upstream em milissegundos
  • X-OmniRoute-Tokens-InContagem de tokens de entrada
  • X-OmniRoute-Tokens-OutContagem de tokens de saída
  • X-OmniRoute-Response-CostCusto desta resposta em USD
  • X-OmniRoute-Cost-SavedUSD evitados num acerto de cache
  • X-OmniRoute-CacheHIT ou MISS em pedidos sem streaming
  • X-OmniRoute-CompressionModo de compressão aplicado e a sua origem
  • X-OmniRoute-Fallback-AttemptsSaltos de fallback efetuados, quando os houve
  • X-OmniRoute-Request-IdId de correlação para o registo de pedidos

Cabeçalhos de pedido

  • x-omniroute-compressionSubstituir o perfil de compressão num único pedido
  • X-OmniRoute-No-CacheContornar a cache semântica
  • x-omniroute-no-memorySaltar a injeção de memória e skills
  • X-Session-IdChave de afinidade de sessão e atribuição de custos
  • Idempotency-KeyDesduplicar um pedido repetido
Ler a referência da API (abre num novo separador)

OmniRoute da Cheaper Inference

Escolha como executa o OmniRoute.

Aloje o OmniRoute, ou use a Cheaper Inference para um gateway alojado ordenado por custo.