Jev: un modelo de decisión que pones delante de tus LLM para enrutar el tráfico
Jev decide, tus LLM responden
TypeSafe lanzó su primer modelo el 15 de septiembre, y lo interesante de Jev es lo que se niega a hacer. No te escribe un párrafo. Le das una petición y te devuelve un valor estructurado — una etiqueta, una clase, una decisión — en, según ellos, 70 a 500 ms. La frase más clara del post es de su fundador, Diogo Almeida: "Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out."
La mayoría de los modelos están hechos para hablar con personas. Jev está hecho para que lo llame el código — y el primer trabajo que le encaja esa forma es el enrutado.
Un modelo hecho para decidir, no para hablar
El nombre cuenta la historia dos veces. "System One" es el término de Kahneman para el juicio rápido y automático — la decisión instantánea — frente a "System Two", el razonamiento lento y deliberado para el que recurrimos a un LLM grande. Y "Jev" es por William Stanley Jevons, el economista de la paradoja de la eficiencia: abarata algo y la gente lo usa mucho más. TypeSafe apuesta a que las decisiones de máquina baratas se usarán en todas partes.
Un modelo de chat genera tokens uno a uno hasta que existe un párrafo. Jev hace lo contrario — TypeSafe dice que "gives up string generation", muestrea todas las salidas en una única consulta paralela, y devuelve un valor de un conjunto que defines de antemano. Salen dos propiedades, y ambas importan para el enrutado:
- La salida es tipada y estructurada, de un conjunto conocido (
SIMPLE,MEDIUM,COMPLEX,REASONING), no prosa que tengas que parsear. TypeSafe afirma que "never makes type errors" — y conviene ser preciso, porque ellos lo son: ese 0% "is not empirical. Schema matching is guaranteed, thus we can confidently add 0%." Es una propiedad de restringir la salida a un esquema, no un resultado medido. - Cada decisión lleva una probabilidad calibrada — "higher confidence means higher accuracy", entrenada con un método que llaman Reinforcement Learning for Calibrated Decisions (RLCD). Si eso se sostiene, el código puede actuar sobre el número: toma la etiqueta con confianza, escala cuando no.
Sus cifras estrella ("40x-200x faster", salida "too cheap to meter", una workflow eval a "193.6x faster, 444.6x cheaper") son afirmaciones del proveedor sobre sus propias evals, y para su crédito señalan el sesgo — las evals fueron "made by individuals on our model capabilities team". Trátalas como afirmaciones hasta que alguien independiente las repita.
Cómo funciona el enrutado, y por qué el que decide es el problema
Enrutar modelos es una jugada de coste. No toda petición necesita tu modelo más grande, así que pones un modelo barato y uno caro detrás de un mismo endpoint y algo delante decide cuál responde. Los turnos fáciles van al nivel barato; los difíciles al caro; la factura baja. Ese "algo delante" es un clasificador:
Construye ese clasificador de la forma habitual — pregúntale a otro LLM "¿esto es simple o complejo?" — y cada petición paga por una llamada a un LLM antes de pagar por la respuesta. Esa llamada es lenta y cuesta tokens, en cada petición, haya acabado en el nivel barato o no. La decisión que debía ahorrar dinero lo está gastando en silencio.
Jev en el hueco del que decide
Jev encaja en ese hueco. No le pides que responda — le pides a qué nivel pertenece la petición, y la pasarela enruta según la etiqueta:
En el Auto Router de LiteLLM eso es un cambio de configuración, no código nuevo —
nombras los niveles, mapeas cada uno a un modelo, y pones classifier_type: jev:
- model_name: jev-router
litellm_params:
model: auto_router/complexity_router
complexity_router_config:
tiers:
SIMPLE: {{openai_small}}
MEDIUM: {{openai_large}}
COMPLEX: {{anthropic}}
REASONING: {{anthropic_large}}
classifier_type: jev
Cuánto vale el cambio — y dónde falla el LLM
El 20 de septiembre, Moe Khalil, de LiteLLM,
publicó un benchmark
titulado "JEV Classifier: 5.43x as Fast as Haiku, 96% Lower Cost." Corrió 80 casos
tres veces cada uno — 240 llamadas — con Jev (jev-1.13.0) contra Claude Haiku 4.5
como línea base de "clasificar con un LLM":
La media esconde el hallazgo real, que está en los números por nivel. En SIMPLE
ambos fueron perfectos (100%). Pero en MEDIUM Haiku se desplomó a 38.33% donde
Jev aguantó 85%, y en REASONING Haiku logró 76.67% frente al 100% de
Jev. Dicho de otro modo, el clasificador LLM distingue bien lo trivial de lo no
trivial, y es poco fiable justo en la banda intermedia donde las decisiones de
enrutado de verdad te ahorran o te cuestan dinero.
Dos salvedades, ambas de LiteLLM, dichas claramente: los niveles esperados "were authored with the synthetic prompts, without independent review", y el benchmark midió la decisión de enrutado, no la calidad de la respuesta final — "downstream answer quality was not measured". Para su crédito, publicaron un archivo de reproducción congelado y verificado por hash para poder re-analizar la corrida. Léelo como "Jev eligió el nivel rápido, barato y como esperaban", no como "tus respuestas salen un 96% más baratas de extremo a extremo".
Dónde encaja en WEC
Construimos este mismo montaje en el tutorial de enrutado por complejidad — una pasarela delante de la WEC Inference API que puntúa cada petición y la manda al nivel correcto, Qwen3.5:9B para los turnos simples y Qwen3.5:122B para los difíciles. Y ya mostramos cómo un clasificador se equivoca con un simple "yes", mandando trabajo al modelo equivocado.
En ambos, el clasificador es la parte que nadie cuenta. Pon un LLM en ese hueco y añades dos tercios de segundo y un cargo en tokens a cada llamada antes siquiera de elegir el modelo real. Un modelo como Jev es una apuesta a que la decisión delante de tus modelos puede ser casi gratis — para que enrutar compense en lugar de cobrarse a sí mismo.
Es pronto, está alojado, y los números todavía necesitan que alguien independiente los repita. Para un stack WEC que mantiene la inferencia en casa, "alojado" es el verdadero signo de interrogación — estarías mandando la decisión de enrutado de cada petición a un tercero. Pero la forma es lo que viaja: un modelo que decide en milisegundos, sentado delante de los modelos que responden.
Fuentes
- Diogo Almeida, TypeSafe — Introducing System One Models and Jev (15 de septiembre de 2026)
- Moe Khalil, LiteLLM — JEV Classifier: 5.43x as Fast as Haiku, 96% Lower Cost (20 de septiembre de 2026)
