Saltar al contenido principal

3 publicaciones etiquetados con "litellm"

Ver Todas las Etiquetas

Jev: un modelo de decisión que pones delante de tus LLM para enrutar el tráfico

· 7 min de lectura
Rafael Fernandes
NLP Engineer & Tech Writer at WiLine
Share:
Enrutado · AI News

Jev decide, tus LLM responden

Llega una peticiónEl modelo correcto, en 127 ms

TypeSafe lanzó su primer modelo el 15 de septiembre, y lo interesante de Jev es lo que se niega a hacer. No te escribe un párrafo. Le das una petición y te devuelve un valor estructurado — una etiqueta, una clase, una decisión — en, según ellos, 70 a 500 ms. La frase más clara del post es de su fundador, Diogo Almeida: "Think of Jev as a frontier-intelligence function call: unstructured state in, typed probabilistic decisions out."

La mayoría de los modelos están hechos para hablar con personas. Jev está hecho para que lo llame el código — y el primer trabajo que le encaja esa forma es el enrutado.

El bug que redujo a la mitad el throughput de un gateway sin un solo error

· 6 min de lectura
Rafael Fernandes
NLP Engineer & Tech Writer at WiLine
Share:
Gateways · AI NewsUn gateway perdiendo la mitad de su throughput sin reportar errores

Pfizer opera un gateway de IA — el único servicio con el que habla cada herramienta interna cuando quiere un modelo. Durante una verificación rutinaria de actualización, su throughput cayó a la mitad. Sin errores. Sin peticiones fallidas. Nada raro en ningún dashboard.

Publicaron lo que encontraron junto al equipo de LiteLLM, y la causa es lo bastante pequeña como para caber en un párrafo: alguien escribió una opción que decía no cifres esta conexión, y el sistema la cifró igual.

Un router que no puede ver la conversación no puede clasificar "yes"

· 8 min de lectura
Rafael Fernandes
NLP Engineer & Tech Writer at WiLine
Share:
Enrutamiento · Noticias de IA

Clasificando la palabra "yes"

Puntuación este mensajePuntuación lo que aprueba

El trabajo de un router de modelos es leer una solicitud y decidir qué modelo debe responderla. Las preguntas baratas van a un modelo pequeño, las difíciles a uno grande, y la factura baja. Todo el arreglo depende de poder distinguir.

Entonces un usuario escribe "yes".

O "continue". O "hazlo". Nada en estas dos o tres letras dice si el trabajo que se está aprobando es una corrección ortográfica o una migración de base de datos. Un router que puntúa el mensaje actual de forma aislada ve una cadena muy corta sin vocabulario técnico, y hace lo obvio: modelo más barato.

Lo que significa que si rutas las solicitudes para ahorrar dinero, tu nivel más barato probablemente esté absorbiendo trabajo que nunca debería haber visto — y tu cifra de ahorro es en parte falsa. El 4 de agosto LiteLLM publicó un benchmark que mide ambas mitades de eso: qué tan mal se equivoca la ruta, y cuánto cuesta arreglarlo.