Noticias de IA
Lecturas breves y de alto valor sobre lo que está cambiando en la infraestructura de IA — nuevas herramientas, lanzamientos y giros — con una mirada clara de lo que cada uno significa si te autoalojas en WiLine.
Jev: un modelo de decisión que pones delante de tus LLM para enrutar el tráfico
Jev es el primer modelo de TypeSafe — no conversa, decide. Le das una petición y devuelve una etiqueta estructurada en unos 127 ms. LiteLLM lo conectó a su Auto Router como clasificador y lo midió 5.43x más rápido y 96% más barato que un Haiku haciendo el mismo trabajo. Esto es qué es Jev, cómo funciona el enrutado, dónde falla de verdad el clasificador LLM, y dónde encaja delante de tus modelos en WEC.
Leer más →El bug que redujo a la mitad el throughput de un gateway sin un solo error
Un ingeniero escribió una opción que decía no cifres esta conexión. El sistema la cifró igual, y después se quedó esperando una respuesta que nunca llegó. El throughput cayó a la mitad, cada petición siguió devolviendo éxito, y ningún dashboard mostró problema alguno. Pfizer y LiteLLM publicaron la historia — y la causa son cuatro líneas de código que cualquiera puede leer.
Leer más →El Arreglo de MCP para los Catálogos de Herramientas Inflados Tiene una Factura — Y Está en los Docs, No en el Roadmap
El roadmap de MCP nombra el inflado del catálogo de herramientas como prioridad. La documentación de clientes ya trae el arreglo — descubrimiento progresivo, con una meta-herramienta search_tools — y esa misma página advierte que puede costar más de lo que ahorra, porque cargar definiciones a mitad de conversación invalida la caché de prompt del proveedor. Tres capas de caché, y el protocolo solo especifica una; la que muerde es la de tu proveedor de modelo.
Leer más →LangChain Acaba de Hacer MCP de Primera Clase — Lo Ejecutamos el Mismo Día, y Tres Cosas Todavía No Funcionan
El soporte de MCP se movió hoy al paquete langchain, construido sobre FastMCP, con elicitación como interrupt de LangGraph y un catálogo de herramientas cacheable. Lo instalamos esa misma tarde y lo apuntamos a un servidor que escribimos contra la nueva especificación. El anuncio es correcto; el ecosistema alrededor no se ha puesto al día, y uno de los huecos convierte una puerta de aprobación humana en una frase que el modelo se inventa.
Leer más →Un agente puede reducir su propia búsqueda web, pero nunca ampliarla
AWS le dio a la búsqueda web de agentes una lista de sitios permitidos el 19 de agosto. El administrador define una lista, el agente puede definir otra, y cuando no coinciden la lista del agente solo puede hacer la búsqueda más pequeña. Esa única regla es la diferencia entre una barrera y una nota en el prompt.
Leer más →Un router que no puede ver la conversación no puede clasificar "yes"
LiteLLM ejecutó 5.600 llamadas de clasificación en tiempo vivo para responder una pregunta: ¿cuánto de la conversación necesita que vea un router de modelos? En las siguientes que solo tienen sentido contra el historial, el acuerdo pasó del 14% al 78% — y la factura de finalización más que se duplicó, porque dos tercios habían estado yendo al modelo más barato.
Leer más →Enmascara tus registros, no tus indicaciones
El consejo de privacidad más común para LLM — eliminar datos personales de la indicación antes de que el modelo los vea — apunta al riesgo equivocado y hace que el modelo sea más tonto. Aquí está lo que realmente muestra la investigación y dónde debería estar el enmascaramiento.
Leer más →Desarrollo guiado por especificaciones: ¿es la solución al Vibe Coding?
Un kit de GitHub con 127 mil estrellas dice que deberías escribir la especificación antes del código, y dejar que el agente construya a partir de ella. Lo ejecuté, y luego leí a los dos ingenieros que lo probaron de verdad — y ambos recurrieron a la misma comparación: la última vez que nuestra industria intentó generar código a partir de documentos.
Leer más →Muse Glimmer: un modelo agentic de 30B que funciona en una GPU, sin necesidad de centro de datos
Meta lanzó un modelo multimodal de 30B construido para cargas de trabajo locales de agentes — supera a Gemma4 y se mantiene frente a Qwen3.6 en benchmarks agentic, y cabe en una sola GPU de consumo. Aquí está lo que realmente es nuevo, y lo que se necesitaría para que llegue a WEC.
Leer más →'La ingeniería de bucles está muerta' — y la verdadera historia es más extraña que el obituario
En junio, 'la ingeniería de bucles' obtuvo un nombre. Seis semanas después fue declarada muerta — y la industria respondió con guías de proveedores, definiciones en competencia y una ola de SEO. Aquí está lo que realmente significan la ingeniería de bucles y la ingeniería de gráficos, por qué un libro de texto gratuito del MIT resuelve el argumento en la página 189, y qué debería enseñarte un ciclo de hype de seis semanas sobre lo que debes aprender.
Leer más →