OmniRoute / Superficie API

Un endpoint, non solo chat.

Chat, embedding, reranking, immagini, video, musica, voce, OCR, file e batch, nel formato di richiesta che il tuo client già parla.

Formati wire

Mantieni il formato di richiesta che il tuo client già invia.

Un solo processo accetta più formati, così a un tool costruito sull'SDK di un vendor basta cambiare il base URL e nient'altro.

OpenAI

Chat Completions, embedding, immagini, audio e file, senza modifiche.

/v1/chat/completions

Anthropic

Il formato wire Messages, incluso il conteggio dei token.

/v1/messages

OpenAI Responses

Il formato della Responses API, con compattazione dell'output dei tool.

/v1/responses

Gemini

generateContent e l'elenco dei modelli Gemini.

/v1beta/models

Ollama

Sostituto diretto per i tool che parlano l'API locale di Ollama.

/v1/api/chat

Rerank and Jina

Reranking Cohere/Voyage più classify e segment di Jina.

/v1/rerank

Endpoint

Non solo chat completions.

Raggruppati in base a cosa vuoi fare, non al provider che di volta in volta lo serve.

Chat e messaggi

Tre formati di richiesta arrivano allo stesso router, così il client mantiene il formato che già parla.

  • POST/v1/chat/completionsOpenAI Chat Completions, in streaming o bufferizzato
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokensConta i token prima di spenderli

Embedding, ricerca e ranking

La metà retrieval di uno stack RAG dietro lo stesso endpoint e la stessa chiave.

  • POST/v1/embeddingsEmbedding testuali e multimodali
  • POST/v1/rerankReranking compatibile con Cohere e Voyage
  • POST/v1/searchAstrazione della ricerca web tra provider
  • POST/v1/classifyClassificazione del testo Jina
  • POST/v1/segmentSegmentazione dei contenuti Jina
  • POST/v1/web/fetchEstrazione di pagine leggibili

Immagini, video e musica

La generazione passa dallo stesso fallback e dalla stessa contabilità dei costi del testo.

  • POST/v1/images/generationsSintesi di immagini
  • POST/v1/images/editsEditing e inpainting
  • POST/v1/videos/generationsGenerazione video
  • POST/v1/music/generationsSintesi musicale

Audio e documenti

Voce in entrambe le direzioni, più OCR per materiale scansionato.

  • POST/v1/audio/transcriptionsDa voce a testo
  • POST/v1/audio/translationsTrascrizione con traduzione
  • POST/v1/audio/speechDa testo a voce
  • POST/v1/ocrOCR di documenti

File e batch

Carica una volta, poi esegui il lavoro in modo asincrono invece di tenere aperta una connessione.

  • POST/v1/filesCarica un file
  • GET/v1/files/{id}/contentRileggi il contenuto del file in streaming
  • POST/v1/batchesCrea un job batch
  • GET/v1/batches/{id}Interroga lo stato del batch
  • POST/v1/batches/{id}/cancelAnnulla un batch in esecuzione

Discovery e controllo

Tutto ciò che serve a un client per scegliere un modello e restare nel budget.

  • GET/v1/modelsCatalogo modelli raggruppato per provider
  • GET/v1/quotas/checkPre-verifica la quota residua
  • POST/v1/moderationsModerazione dei contenuti
  • GET/v1/wsUpgrade WebSocket per client in streaming

Protocolli agente

Un server MCP con 110 tool e una agent card A2A, serviti dallo stesso processo.

  • GET/api/mcp/streamMCP su HTTP, 33 scope
  • GET/api/mcp/sseMCP su Server-Sent Events
  • POST/a2aJSON-RPC 2.0, 6 skill agente
  • GET/.well-known/agent.jsonAgent card pubblica

Header

Ogni risposta dice come è stata servita.

Il routing non è una scatola nera: la decisione, il costo e la compressione che hanno prodotto una risposta viaggiano insieme a essa.

Header di risposta

  • X-OmniRoute-DecisionStrategia, alias del provider e latenza che hanno servito la richiesta
  • X-OmniRoute-ProviderL'alias del provider effettivamente usato
  • X-OmniRoute-ModelL'identificatore del modello risolto
  • X-OmniRoute-Latency-MsLatenza upstream in millisecondi
  • X-OmniRoute-Tokens-InNumero di token in input
  • X-OmniRoute-Tokens-OutNumero di token in output
  • X-OmniRoute-Response-CostCosto in USD di questa risposta
  • X-OmniRoute-Cost-SavedUSD evitati con un cache hit
  • X-OmniRoute-CacheHIT o MISS sulle richieste non in streaming
  • X-OmniRoute-CompressionModalità di compressione applicata e sua origine
  • X-OmniRoute-Fallback-AttemptsSalti di fallback effettuati, se presenti
  • X-OmniRoute-Request-IdId di correlazione per il log delle richieste

Header di richiesta

  • x-omniroute-compressionSovrascrivi il profilo di compressione per una richiesta
  • X-OmniRoute-No-CacheBypassa la cache semantica
  • x-omniroute-no-memorySalta l'iniezione di memoria e skill
  • X-Session-IdChiave di affinità di sessione e attribuzione dei costi
  • Idempotency-KeyDeduplica una richiesta ritentata
Leggi il riferimento API (si apre in una nuova scheda)

OmniRoute di Cheaper Inference

Scegli come eseguire OmniRoute.

Fai self-hosting di OmniRoute oppure usa Cheaper Inference per un gateway hosted ordinato per costo.