OmniRoute / Enrutamiento y control

Elige cómo se mueve cada solicitud.

Consulta las estrategias de enrutamiento, la contabilidad de niveles gratuitos, la compresión, el aislamiento de fallos y los controles de red.

Estrategias de enrutamiento

Elige una ruta `auto` o crea la tuya.

Usa un modo listo para usar o combina 19 estrategias en torno al objetivo que te importa.

Modelo · fallback activadoautoBalanced default
Solicitud compatible con OpenAI
curl http://localhost:20128/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Write a TypeScript retry helper."}]}'

Routing alias auto selected. Objective: Balanced default. Fallback enabled.

Agota la cuota de suscripción

Usa la cuota que ya tienes antes de tocar las APIs de pago.

priority · fill-first

Reparte la carga

Equilibra el tráfico entre claves y cuentas para reducir la presión de los límites de tasa.

weighted · round-robin · p2c · least-used · headroom

Lo más barato primero

Enruta al destino elegible de menor coste.

cost-optimized

Según el contexto

Mantén los contextos largos en modelos que los admitan y reenvía cuando haga falta.

context-relay · context-optimized · cache-optimized

Aleatorio

Distribuye el tráfico elegible entre los destinos.

random · strict-random

Puntuación adaptativa

Usa puntuación de 15 factores, último estado bueno conocido y ventanas que tienen en cuenta los reinicios.

reset-window · reset-aware · lkgp · auto · fusion · pipeline

Contabilidad de niveles gratuitos

Aproximadamente 1.51B tokens publicados cada mes.

455 entradas del catálogo se deduplican en 40 pools recurrentes; solo los presupuestos positivos publicados alimentan la cifra principal.

1.51B

La contabilidad deduplicada por pool evita que las cuotas compartidas se cuenten más de una vez. Los proveedores sin límite siguen visibles sin inflar el total de tokens. Checked 2026-08-30.

View the calculation (se abre en una pestaña nueva)
Proveedores gratuitos para siempre, recurrentes o sin clave56
  • Mistral1B/month
  • LLM7150M/month
  • Nara150M/month
  • Gemini CLI · forever60M/month
  • Kiro50 credits/month
  • Qoder · foreverFree catalog
  • LongCat · forever50M/day
  • Cerebras1M/day
  • NVIDIA NIM~40 RPM
  • Pollinations · foreverNo key
  • Cloudflare Workers AI · foreverDaily neurons
  • OpenCode Free · foreverNo-auth catalog

Compresión de contexto

Reduce los tokens elegibles en 15–95%.

La salida de herramientas, el contexto repetido y los datos estructurados inflados pueden comprimirse antes de llegar al modelo.

Illustrative Ultra profile example from the audited documentation.

Before69 tokens
The function should iterate over the list of items, and for each item, it should check whether the value is greater than zero, and if so, add it to the running total.
After19 tokens
sum all list items where value > 0

Composable pipeline

  1. Session-Dedup
    Descarta el contenido ya enviado antes en la sesión.
  2. CCR
    Archiva bloques grandes y restáuralos a demanda.
  3. Lite
    Aplica una limpieza conservadora sin pérdidas.
  4. RTK
    Filtra y deduplica la salida de comandos y herramientas.
  5. Responses Tool Output
    Compacta los payloads de herramientas de Responses API.
  6. Headroom
    Aplica compactación reversible de datos tabulares y estructurados.
  7. Relevance
    Conserva las frases más relevantes para la última consulta.
  8. Caveman
    Usa condensación de prosa basada en reglas.
  9. Aggressive
    Aplica una poda configurada más agresiva.
  10. LLMLingua-2
    Usa poda semántica segura para código en un worker aislado.
  11. Ultra
    Combina etapas de alto ahorro con protecciones de preservación.
  12. OmniGlyph
    Codifica de forma compacta las estructuras repetidas elegibles.

Profiles

Rango publicado del perfil~30%x-omniroute-compression: standard

Compresión Standard seleccionada. Rango publicado ~30%.

Controls and output styles

  • Perfiles con nombre y selector activo
  • Visual Compression Studio
  • Anthropic Context Editing
  • Dial adaptativo de presupuesto de contexto
  • Cabecera \
  • por solicitud
  • Harness de evaluación offline
  • Activación automática por umbral de tokens
  • Terse prose
  • Less code (YAGNI)
  • Terse CJK 文言

Precedencia de control: cabecera de la solicitud → combo → perfil → política adaptativa → valor por defecto.

Aislamiento de fallos

Aísla los fallos de proveedor, conexión y modelo.

Una clave mala no debería tumbar un proveedor. Un modelo limitado no debería tumbar una conexión.

modelo ⊂ conexión ⊂ proveedor
Circuit breaker de proveedorCuando un proveedor no está sano, el enrutamiento por combo lo omite hasta que una sonda en estado semiabierto tiene éxito.
Enfriamiento de conexiónEnfría una clave o cuenta mientras las conexiones hermanas siguen sirviendo.
Bloqueo de modeloBloquea un modelo limitado por tasa o no disponible mientras los demás modelos de la conexión siguen disponibles.

Controles de red y datos locales

Controles de enrutamiento de red y datos locales.

Los ámbitos de proxy controlan el enrutamiento de red mientras el almacenamiento local primero mantiene los datos operativos en tu máquina.

Tres ámbitos de proxy

Enruta de forma global, por proveedor o por conexión individual.

  • Global · por proveedor · por conexión
  • Proxies SOCKS5 y HTTP(S)
  • Integración con marketplace de proxies

Controles de huella TLS y de cliente

Imita los clientes de proveedores compatibles hasta en características de transporte seleccionadas.

  • Transporte con soporte JA3/JA4 vía wreq-js
  • Perfiles de cliente específicos por proveedor
  • Controles de salida IPv4 e IPv6

Privado y local primero

Las claves, el uso y el historial se quedan en el host que tú controlas.

  • SQLite en disco con credenciales cifradas con AES-256-GCM
  • No requiere cuenta de OmniRoute
  • Autoaloja en la infraestructura que elijas
RusiaChinaIránCubaTurquía

OmniRoute de Cheaper Inference

Elige cómo ejecutar OmniRoute.

Autoaloja OmniRoute o usa Cheaper Inference para un gateway alojado clasificado por coste.