OmniRoute / Superfície da API

Um endpoint, muito além do chat.

Chat, embeddings, reranking, imagens, vídeo, música, fala, OCR, arquivos e lotes, no formato de requisição que seu cliente já usa.

Formatos de requisição

Mantenha o formato de requisição que seu cliente já envia.

Um processo aceita vários formatos, então uma ferramenta feita para o SDK de um fornecedor só precisa trocar a URL base e nada mais.

OpenAI

Chat Completions, embeddings, imagens, áudio e arquivos, sem alterações.

/v1/chat/completions

Anthropic

O formato Messages, incluindo contagem de tokens.

/v1/messages

OpenAI Responses

O formato da Responses API, com compactação de saída de ferramentas.

/v1/responses

Gemini

generateContent e a listagem de modelos do Gemini.

/v1beta/models

Ollama

Substituto direto para ferramentas que falam a API local do Ollama.

/v1/api/chat

Rerank and Jina

Reranking Cohere/Voyage mais classify e segment da Jina.

/v1/rerank

Endpoints

Muito além de chat completions.

Agrupados pelo que você quer fazer, e não pelo provedor que por acaso atende.

Chat e mensagens

Três formatos de requisição chegam ao mesmo roteador, então o cliente mantém o formato que já usa.

  • POST/v1/chat/completionsOpenAI Chat Completions, em streaming ou bufferizado
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokensConte tokens antes de gastá-los

Embeddings, busca e ranking

A metade de recuperação de uma stack RAG atrás do mesmo endpoint e da mesma chave.

  • POST/v1/embeddingsEmbeddings de texto e multimodais
  • POST/v1/rerankReranking compatível com Cohere e Voyage
  • POST/v1/searchAbstração de busca web entre provedores
  • POST/v1/classifyClassificação de texto da Jina
  • POST/v1/segmentSegmentação de conteúdo da Jina
  • POST/v1/web/fetchExtração de página legível

Imagem, vídeo e música

A geração passa pelo mesmo fallback e pela mesma contabilidade de custos que o texto.

  • POST/v1/images/generationsSíntese de imagens
  • POST/v1/images/editsEdição e inpainting
  • POST/v1/videos/generationsGeração de vídeo
  • POST/v1/music/generationsSíntese de música

Áudio e documentos

Fala nos dois sentidos, mais OCR para material digitalizado.

  • POST/v1/audio/transcriptionsFala para texto
  • POST/v1/audio/translationsTranscrição com tradução
  • POST/v1/audio/speechTexto para fala
  • POST/v1/ocrOCR de documentos

Arquivos e lotes

Envie uma vez e execute o trabalho de forma assíncrona em vez de manter uma conexão aberta.

  • POST/v1/filesEnviar um arquivo
  • GET/v1/files/{id}/contentTransmitir o conteúdo do arquivo de volta
  • POST/v1/batchesCriar um job em lote
  • GET/v1/batches/{id}Consultar o status do lote
  • POST/v1/batches/{id}/cancelCancelar um lote em execução

Descoberta e controle

Tudo que um cliente precisa para escolher um modelo e ficar dentro do orçamento.

  • GET/v1/modelsCatálogo de modelos agrupado por provedor
  • GET/v1/quotas/checkPré-validar a cota restante
  • POST/v1/moderationsModeração de conteúdo
  • GET/v1/wsUpgrade para WebSocket em clientes de streaming

Protocolos de agentes

Um servidor MCP com 110 ferramentas e um agent card A2A, servidos pelo mesmo processo.

  • GET/api/mcp/streamMCP via HTTP, 33 escopos
  • GET/api/mcp/sseMCP via Server-Sent Events
  • POST/a2aJSON-RPC 2.0, 6 skills de agente
  • GET/.well-known/agent.jsonAgent card público

Headers

Toda resposta diz como foi atendida.

O roteamento não é uma caixa-preta: a decisão, o custo e a compressão que produziram uma resposta voltam junto com ela.

Headers de resposta

  • X-OmniRoute-DecisionEstratégia, alias do provedor e latência que atenderam a requisição
  • X-OmniRoute-ProviderO alias do provedor para o qual a requisição foi roteada
  • X-OmniRoute-ModelO identificador do modelo resolvido
  • X-OmniRoute-Latency-MsLatência upstream em milissegundos
  • X-OmniRoute-Tokens-InContagem de tokens de entrada
  • X-OmniRoute-Tokens-OutContagem de tokens de saída
  • X-OmniRoute-Response-CostCusto em USD desta resposta
  • X-OmniRoute-Cost-SavedUSD evitados em um acerto de cache
  • X-OmniRoute-CacheHIT ou MISS em requisições sem streaming
  • X-OmniRoute-CompressionModo de compressão aplicado e de onde veio
  • X-OmniRoute-Fallback-AttemptsSaltos de fallback realizados, quando houve
  • X-OmniRoute-Request-IdId de correlação para o log de requisições

Headers de requisição

  • x-omniroute-compressionSobrescreva o perfil de compressão em uma requisição
  • X-OmniRoute-No-CacheIgnore o cache semântico
  • x-omniroute-no-memoryPule a injeção de memória e skills
  • X-Session-IdChave de afinidade de sessão e atribuição de custos
  • Idempotency-KeyDeduplique uma requisição repetida
Ler a referência da API (abre em uma nova aba)

OmniRoute da Cheaper Inference

Escolha como você roda o OmniRoute.

Auto-hospede o OmniRoute ou use a Cheaper Inference para um gateway hospedado ordenado por custo.