OmniRoute / Powierzchnia API

Jeden endpoint, więcej niż chat.

Chat, embeddingi, reranking, obrazy, wideo, muzyka, mowa, OCR, pliki i batche, w formacie żądań, którego twój klient już używa.

Formaty żądań

Zachowaj kształt żądania, który twój klient już wysyła.

Jeden proces przyjmuje kilka formatów, więc narzędzie zbudowane na SDK jednego dostawcy potrzebuje tylko zmiany base URL.

OpenAI

Chat Completions, embeddingi, obrazy, audio i pliki, bez zmian.

/v1/chat/completions

Anthropic

Format Messages, łącznie z liczeniem tokenów.

/v1/messages

OpenAI Responses

Kształt Responses API, z kompakcją wyjścia narzędzi.

/v1/responses

Gemini

generateContent i lista modeli Gemini.

/v1beta/models

Ollama

Zamiennik dla narzędzi używających lokalnego API Ollama.

/v1/api/chat

Rerank and Jina

Reranking Cohere/Voyage oraz klasyfikacja i segmentacja Jina.

/v1/rerank

Endpointy

Więcej niż chat completions.

Pogrupowane według tego, co chcesz zrobić, a nie według dostawcy, który akurat to obsługuje.

Chat i wiadomości

Trzy kształty żądań trafiają do tego samego routera, więc klient zachowuje format, którego już używa.

  • POST/v1/chat/completionsOpenAI Chat Completions, strumieniowo lub buforowane
  • POST/v1/messagesAnthropic Messages
  • POST/v1/responsesOpenAI Responses
  • POST/v1/messages/count_tokensPolicz tokeny, zanim je wydasz

Embeddingi, wyszukiwanie i ranking

Część retrieval stacku RAG za tym samym endpointem i tym samym kluczem.

  • POST/v1/embeddingsEmbeddingi tekstowe i multimodalne
  • POST/v1/rerankReranking zgodny z Cohere i Voyage
  • POST/v1/searchAbstrakcja wyszukiwania web między dostawcami
  • POST/v1/classifyKlasyfikacja tekstu Jina
  • POST/v1/segmentSegmentacja treści Jina
  • POST/v1/web/fetchEkstrakcja czytelnej treści strony

Obraz, wideo i muzyka

Generowanie przechodzi przez ten sam fallback i rozliczanie kosztów co tekst.

  • POST/v1/images/generationsSynteza obrazów
  • POST/v1/images/editsEdycja i inpainting
  • POST/v1/videos/generationsGenerowanie wideo
  • POST/v1/music/generationsSynteza muzyki

Audio i dokumenty

Mowa w obu kierunkach oraz OCR dla zeskanowanych materiałów źródłowych.

  • POST/v1/audio/transcriptionsMowa na tekst
  • POST/v1/audio/translationsTranskrypcja z tłumaczeniem
  • POST/v1/audio/speechTekst na mowę
  • POST/v1/ocrOCR dokumentów

Pliki i batche

Wgraj raz, a potem wykonuj pracę asynchronicznie zamiast trzymać otwarte połączenie.

  • POST/v1/filesWgraj plik
  • GET/v1/files/{id}/contentStrumieniuj zawartość pliku z powrotem
  • POST/v1/batchesUtwórz zadanie batch
  • GET/v1/batches/{id}Sprawdź status batcha
  • POST/v1/batches/{id}/cancelAnuluj działający batch

Odkrywanie i kontrola

Wszystko, czego klient potrzebuje, by wybrać model i zmieścić się w budżecie.

  • GET/v1/modelsKatalog modeli pogrupowany po dostawcach
  • GET/v1/quotas/checkSprawdź pozostały limit z wyprzedzeniem
  • POST/v1/moderationsModeracja treści
  • GET/v1/wsUpgrade do WebSocket dla klientów strumieniowych

Protokoły agentów

Serwer MCP z 110 narzędziami i karta agenta A2A, serwowane przez ten sam proces.

  • GET/api/mcp/streamMCP przez HTTP, 33 zakresów
  • GET/api/mcp/sseMCP przez Server-Sent Events
  • POST/a2aJSON-RPC 2.0, 6 umiejętności agenta
  • GET/.well-known/agent.jsonPubliczna karta agenta

Nagłówki

Każda odpowiedź mówi, jak została obsłużona.

Routing nie jest czarną skrzynką: decyzja, koszt i kompresja, które złożyły się na odpowiedź, wracają razem z nią.

Nagłówki odpowiedzi

  • X-OmniRoute-DecisionStrategia, alias dostawcy i opóźnienie, które obsłużyły żądanie
  • X-OmniRoute-ProviderAlias dostawcy, do którego faktycznie trafiło żądanie
  • X-OmniRoute-ModelRozwiązany identyfikator modelu
  • X-OmniRoute-Latency-MsOpóźnienie upstreamu w milisekundach
  • X-OmniRoute-Tokens-InLiczba tokenów wejściowych
  • X-OmniRoute-Tokens-OutLiczba tokenów wyjściowych
  • X-OmniRoute-Response-CostKoszt tej odpowiedzi w USD
  • X-OmniRoute-Cost-SavedUSD zaoszczędzone przy trafieniu w cache
  • X-OmniRoute-CacheHIT lub MISS dla żądań niestrumieniowych
  • X-OmniRoute-CompressionZastosowany tryb kompresji i jego źródło
  • X-OmniRoute-Fallback-AttemptsWykonane skoki fallbacku, jeśli były
  • X-OmniRoute-Request-IdIdentyfikator korelacji dla logu żądań

Nagłówki żądania

  • x-omniroute-compressionNadpisz profil kompresji dla jednego żądania
  • X-OmniRoute-No-CachePomiń cache semantyczny
  • x-omniroute-no-memoryPomiń wstrzykiwanie pamięci i umiejętności
  • X-Session-IdKlucz powinowactwa sesji i przypisania kosztów
  • Idempotency-KeyDeduplikuj powtórzone żądanie
Czytaj dokumentację API (otwiera się w nowej karcie)

OmniRoute od Cheaper Inference

Wybierz, jak uruchamiasz OmniRoute.

Hostuj OmniRoute samodzielnie lub użyj Cheaper Inference, hostowanej bramy z rankingiem kosztów.