OmniRoute / Suprafața API

Un endpoint, mai mult decât chat.

Chat, embeddings, reranking, imagini, video, muzică, vorbire, OCR, fișiere și batch-uri, în formatul de cerere pe care clientul tău îl vorbește deja.

Formate de transport

Păstrează forma cererii pe care clientul tău o trimite deja.

Un singur proces acceptă mai multe formate, așa că un tool construit pe SDK-ul unui vendor are nevoie doar de o schimbare a URL-ului de bază.

OpenAI

Chat Completions, embeddings, imagini, audio și fișiere, neschimbate.

/v1/chat/completions

Anthropic

Formatul Messages, inclusiv numărarea tokenilor.

/v1/messages

OpenAI Responses

Forma Responses API, cu compactarea output-ului tool-urilor.

/v1/responses

Gemini

generateContent și lista de modele Gemini.

/v1beta/models

Ollama

Înlocuitor direct pentru tool-urile care vorbesc API-ul local Ollama.

/v1/api/chat

Rerank and Jina

Reranking Cohere/Voyage plus Jina classify și segment.

/v1/rerank

Endpoint-uri

Mai mult decât chat completions.

Grupate după ce vrei să faci, nu după furnizorul care se întâmplă să servească.

Chat și mesaje

Trei forme de cerere ajung la același router, așa că un client păstrează formatul pe care îl vorbește deja.

  • POST/v1/chat/completionsOpenAI Chat Completions, streaming sau buffered
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokensNumără tokenii înainte să-i cheltuiești

Embeddings, căutare și ranking

Jumătatea de retrieval a unui stack RAG, în spatele aceluiași endpoint și al aceleiași chei.

  • POST/v1/embeddingsEmbeddings text și multimodale
  • POST/v1/rerankReranking compatibil Cohere și Voyage
  • POST/v1/searchAbstracție de căutare web peste furnizori
  • POST/v1/classifyClasificare de text Jina
  • POST/v1/segmentSegmentare de conținut Jina
  • POST/v1/web/fetchExtragere de pagini în format lizibil

Imagine, video și muzică

Generarea trece prin același fallback și aceeași contabilizare a costurilor ca textul.

  • POST/v1/images/generationsSinteză de imagini
  • POST/v1/images/editsEditare și inpainting
  • POST/v1/videos/generationsGenerare video
  • POST/v1/music/generationsSinteză muzicală

Audio și documente

Vorbire în ambele direcții, plus OCR pentru materiale sursă scanate.

  • POST/v1/audio/transcriptionsVorbire în text
  • POST/v1/audio/translationsTranscriere cu traducere
  • POST/v1/audio/speechText în vorbire
  • POST/v1/ocrOCR pentru documente

Fișiere și batch-uri

Încarcă o dată, apoi rulează lucrul asincron în loc să ții o conexiune deschisă.

  • POST/v1/filesÎncarcă un fișier
  • GET/v1/files/{id}/contentRedă conținutul fișierului în stream
  • POST/v1/batchesCreează un job batch
  • GET/v1/batches/{id}Interoghează starea batch-ului
  • POST/v1/batches/{id}/cancelAnulează un batch în curs

Descoperire și control

Tot ce are nevoie un client pentru a alege un model și a rămâne în buget.

  • GET/v1/modelsCatalog de modele grupat pe furnizori
  • GET/v1/quotas/checkVerifică în avans cota rămasă
  • POST/v1/moderationsModerare de conținut
  • GET/v1/wsUpgrade WebSocket pentru clienți de streaming

Protocoale de agenți

Un server MCP cu 110 tool-uri și un agent card A2A, servite de același proces.

  • GET/api/mcp/streamMCP prin HTTP, 33 scope-uri
  • GET/api/mcp/sseMCP prin Server-Sent Events
  • POST/a2aJSON-RPC 2.0, 6 skill-uri de agent
  • GET/.well-known/agent.jsonAgent card public

Header-e

Fiecare răspuns spune cum a fost servit.

Rutarea nu e o cutie neagră: decizia, costul și compresia care au produs un răspuns se întorc împreună cu el.

Header-e de răspuns

  • X-OmniRoute-DecisionStrategia, aliasul furnizorului și latența care au servit cererea
  • X-OmniRoute-ProviderAliasul furnizorului către care s-a rutat efectiv
  • X-OmniRoute-ModelIdentificatorul de model rezolvat
  • X-OmniRoute-Latency-MsLatența upstream în milisecunde
  • X-OmniRoute-Tokens-InNumăr de tokeni de intrare
  • X-OmniRoute-Tokens-OutNumăr de tokeni de ieșire
  • X-OmniRoute-Response-CostCostul în USD al acestui răspuns
  • X-OmniRoute-Cost-SavedUSD evitați la un cache hit
  • X-OmniRoute-CacheHIT sau MISS la cererile fără streaming
  • X-OmniRoute-CompressionModul de compresie aplicat și de unde a venit
  • X-OmniRoute-Fallback-AttemptsSalturile de fallback făcute, dacă au existat
  • X-OmniRoute-Request-IdId de corelare pentru jurnalul de cereri

Header-e de cerere

  • x-omniroute-compressionSuprascrie profilul de compresie pentru o cerere
  • X-OmniRoute-No-CacheOcolește cache-ul semantic
  • x-omniroute-no-memorySari peste injectarea memoriei și a skill-urilor
  • X-Session-IdCheie de afinitate a sesiunii și atribuire a costurilor
  • Idempotency-KeyDeduplică o cerere reîncercată
Citește referința API (se deschide într-o filă nouă)

OmniRoute by Cheaper Inference

Alege cum rulezi OmniRoute.

Găzduiește OmniRoute pe cont propriu sau folosește Cheaper Inference pentru un gateway găzduit, ordonat după cost.