OpenAI
Chat Completions, Embeddings, Bilder, Audio und Dateien, unverändert.
/v1/chat/completionsOmniRoute / API-Oberfläche
Chat, Embeddings, Reranking, Bilder, Video, Musik, Sprache, OCR, Dateien und Batches, im Anfrageformat, das dein Client bereits spricht.
Wire-Formate
Ein Prozess akzeptiert mehrere Formate, sodass ein gegen das SDK eines Anbieters gebautes Tool nur eine neue Basis-URL braucht und sonst nichts.
Chat Completions, Embeddings, Bilder, Audio und Dateien, unverändert.
/v1/chat/completionsDas Messages-Wire-Format, inklusive Token-Zählung.
/v1/messagesDie Responses-API-Struktur, mit Verdichtung der Tool-Ausgaben.
/v1/responsesgenerateContent und die Gemini-Modellliste.
/v1beta/modelsDrop-in für Tools, die die lokale Ollama-API sprechen.
/v1/api/chatCohere/Voyage-Reranking plus Jina Classify und Segment.
/v1/rerankEndpunkte
Gruppiert nach dem, was du erreichen willst, statt danach, welcher Anbieter es gerade bedient.
Drei Anfrageformate erreichen denselben Router, sodass ein Client das Format behält, das er bereits spricht.
/v1/chat/completionsOpenAI Chat Completions, gestreamt oder gepuffert/v1/messagesAnthropic Messages/v1/responsesOpenAI Responses/v1/messages/count_tokensTokens zählen, bevor sie ausgegeben werdenDie Retrieval-Hälfte eines RAG-Stacks hinter demselben Endpunkt und demselben Schlüssel.
/v1/embeddingsText- und multimodale Embeddings/v1/rerankCohere- und Voyage-kompatibles Reranking/v1/searchWebsuche-Abstraktion über Anbieter hinweg/v1/classifyJina-Textklassifikation/v1/segmentJina-Inhaltssegmentierung/v1/web/fetchLesbare SeitenextraktionGenerierung läuft über denselben Fallback und dieselbe Kostenrechnung wie Text.
/v1/images/generationsBildsynthese/v1/images/editsBearbeitung und Inpainting/v1/videos/generationsVideogenerierung/v1/music/generationsMusiksyntheseSprache in beide Richtungen, plus OCR für gescannte Quellen.
/v1/audio/transcriptionsSprache zu Text/v1/audio/translationsÜbersetzende Transkription/v1/audio/speechText zu Sprache/v1/ocrDokument-OCREinmal hochladen, dann asynchron verarbeiten, statt eine Verbindung offen zu halten.
/v1/filesDatei hochladen/v1/files/{id}/contentDateiinhalt zurückstreamen/v1/batchesBatch-Job erstellen/v1/batches/{id}Batch-Status abfragen/v1/batches/{id}/cancelLaufenden Batch abbrechenAlles, was ein Client braucht, um ein Modell zu wählen und im Budget zu bleiben.
/v1/modelsNach Anbieter gruppierter Modellkatalog/v1/quotas/checkRestkontingent vorab prüfen/v1/moderationsInhaltsmoderation/v1/wsWebSocket-Upgrade für Streaming-ClientsEin MCP-Server mit 110 Tools und eine A2A-Agent-Card, bereitgestellt vom selben Prozess.
/api/mcp/streamMCP über HTTP, 33 Scopes/api/mcp/sseMCP über Server-Sent Events/a2aJSON-RPC 2.0, 6 Agent-Skills/.well-known/agent.jsonÖffentliche Agent CardHeader
Routing ist keine Blackbox: Entscheidung, Kosten und Kompression, die eine Antwort erzeugt haben, reisen mit ihr zurück.
X-OmniRoute-DecisionStrategie, Anbieter-Alias und Latenz, die die Anfrage bedient habenX-OmniRoute-ProviderDer tatsächlich angesteuerte Anbieter-AliasX-OmniRoute-ModelDie aufgelöste ModellkennungX-OmniRoute-Latency-MsUpstream-Latenz in MillisekundenX-OmniRoute-Tokens-InAnzahl Eingabe-TokensX-OmniRoute-Tokens-OutAnzahl Ausgabe-TokensX-OmniRoute-Response-CostKosten dieser Antwort in USDX-OmniRoute-Cost-SavedBei einem Cache-Hit vermiedene USDX-OmniRoute-CacheHIT oder MISS bei nicht gestreamten AnfragenX-OmniRoute-CompressionAngewandter Kompressionsmodus und seine HerkunftX-OmniRoute-Fallback-AttemptsDurchgeführte Fallback-Hops, falls vorhandenX-OmniRoute-Request-IdKorrelations-ID für das Request-Logx-omniroute-compressionKompressionsprofil für eine Anfrage überschreibenX-OmniRoute-No-CacheSemantischen Cache umgehenx-omniroute-no-memoryMemory- und Skills-Injection überspringenX-Session-IdSchlüssel für Session-Affinität und KostenzuordnungIdempotency-KeyWiederholte Anfrage deduplizieren