Saltar al contenido principal

Noticias de IA

Lecturas breves y de alto valor sobre lo que está cambiando en la infraestructura de IA — nuevas herramientas, lanzamientos y giros — con una mirada clara de lo que cada uno significa si te autoalojas en WiLine.

Jev: un modelo de decisión que pones delante de tus LLM para enrutar el tráfico

· 7 min de lectura

Jev es el primer modelo de TypeSafe — no conversa, decide. Le das una petición y devuelve una etiqueta estructurada en unos 127 ms. LiteLLM lo conectó a su Auto Router como clasificador y lo midió 5.43x más rápido y 96% más barato que un Haiku haciendo el mismo trabajo. Esto es qué es Jev, cómo funciona el enrutado, dónde falla de verdad el clasificador LLM, y dónde encaja delante de tus modelos en WEC.

ai-newsroutingcostlitellmmodels
Leer más →

El bug que redujo a la mitad el throughput de un gateway sin un solo error

· 6 min de lectura

Un ingeniero escribió una opción que decía no cifres esta conexión. El sistema la cifró igual, y después se quedó esperando una respuesta que nunca llegó. El throughput cayó a la mitad, cada petición siguió devolviendo éxito, y ningún dashboard mostró problema alguno. Pfizer y LiteLLM publicaron la historia — y la causa son cuatro líneas de código que cualquiera puede leer.

ai-newslitellmgatewayredisobservabilityinfrastructure
Leer más →

El Arreglo de MCP para los Catálogos de Herramientas Inflados Tiene una Factura — Y Está en los Docs, No en el Roadmap

· 8 min de lectura

El roadmap de MCP nombra el inflado del catálogo de herramientas como prioridad. La documentación de clientes ya trae el arreglo — descubrimiento progresivo, con una meta-herramienta search_tools — y esa misma página advierte que puede costar más de lo que ahorra, porque cargar definiciones a mitad de conversación invalida la caché de prompt del proveedor. Tres capas de caché, y el protocolo solo especifica una; la que muerde es la de tu proveedor de modelo.

ai-newsmcpagentesprotocolscontext-engineeringinfrastructure
Leer más →

LangChain Acaba de Hacer MCP de Primera Clase — Lo Ejecutamos el Mismo Día, y Tres Cosas Todavía No Funcionan

· 11 min de lectura

El soporte de MCP se movió hoy al paquete langchain, construido sobre FastMCP, con elicitación como interrupt de LangGraph y un catálogo de herramientas cacheable. Lo instalamos esa misma tarde y lo apuntamos a un servidor que escribimos contra la nueva especificación. El anuncio es correcto; el ecosistema alrededor no se ha puesto al día, y uno de los huecos convierte una puerta de aprobación humana en una frase que el modelo se inventa.

ai-newsmcplangchainlanggraphagentesprotocols
Leer más →

Un agente puede reducir su propia búsqueda web, pero nunca ampliarla

· 5 min de lectura

AWS le dio a la búsqueda web de agentes una lista de sitios permitidos el 19 de agosto. El administrador define una lista, el agente puede definir otra, y cuando no coinciden la lista del agente solo puede hacer la búsqueda más pequeña. Esa única regla es la diferencia entre una barrera y una nota en el prompt.

ai-newsagentesmcpguardrailsgobernanzaweb-search
Leer más →

Un router que no puede ver la conversación no puede clasificar "yes"

· 8 min de lectura

LiteLLM ejecutó 5.600 llamadas de clasificación en tiempo vivo para responder una pregunta: ¿cuánto de la conversación necesita que vea un router de modelos? En las siguientes que solo tienen sentido contra el historial, el acuerdo pasó del 14% al 78% — y la factura de finalización más que se duplicó, porque dos tercios habían estado yendo al modelo más barato.

ai-newsenrutamientoevalscostelitellm
Leer más →

Enmascara tus registros, no tus indicaciones

· 8 min de lectura

El consejo de privacidad más común para LLM — eliminar datos personales de la indicación antes de que el modelo los vea — apunta al riesgo equivocado y hace que el modelo sea más tonto. Aquí está lo que realmente muestra la investigación y dónde debería estar el enmascaramiento.

ai-newsprivacypiiguardrailsgateway
Leer más →

Desarrollo guiado por especificaciones: ¿es la solución al Vibe Coding?

· 14 min de lectura

Un kit de GitHub con 127 mil estrellas dice que deberías escribir la especificación antes del código, y dejar que el agente construya a partir de ella. Lo ejecuté, y luego leí a los dos ingenieros que lo probaron de verdad — y ambos recurrieron a la misma comparación: la última vez que nuestra industria intentó generar código a partir de documentos.

ai-newsengineering-practiceagentesevalstooling
Leer más →

Muse Glimmer: un modelo agentic de 30B que funciona en una GPU, sin necesidad de centro de datos

· 4 min de lectura

Meta lanzó un modelo multimodal de 30B construido para cargas de trabajo locales de agentes — supera a Gemma4 y se mantiene frente a Qwen3.6 en benchmarks agentic, y cabe en una sola GPU de consumo. Aquí está lo que realmente es nuevo, y lo que se necesitaría para que llegue a WEC.

ai-newsmodelsopen-weightagenteslocal-inference
Leer más →

'La ingeniería de bucles está muerta' — y la verdadera historia es más extraña que el obituario

· 15 min de lectura

En junio, 'la ingeniería de bucles' obtuvo un nombre. Seis semanas después fue declarada muerta — y la industria respondió con guías de proveedores, definiciones en competencia y una ola de SEO. Aquí está lo que realmente significan la ingeniería de bucles y la ingeniería de gráficos, por qué un libro de texto gratuito del MIT resuelve el argumento en la página 189, y qué debería enseñarte un ciclo de hype de seis semanas sobre lo que debes aprender.

ai-newsagentesarchitectureorchestrationengineering-practice
Leer más →