Saltar al contenido principal

3 publicaciones etiquetados con "evals"

Ver Todas las Etiquetas

Un router que no puede ver la conversación no puede clasificar "yes"

· 8 min de lectura
Rafael Fernandes
NLP Engineer & Tech Writer at WiLine
Share:
Enrutamiento · Noticias de IA

Clasificando la palabra "yes"

Puntuación este mensajePuntuación lo que aprueba

El trabajo de un router de modelos es leer una solicitud y decidir qué modelo debe responderla. Las preguntas baratas van a un modelo pequeño, las difíciles a uno grande, y la factura baja. Todo el arreglo depende de poder distinguir.

Entonces un usuario escribe "yes".

O "continue". O "hazlo". Nada en estas dos o tres letras dice si el trabajo que se está aprobando es una corrección ortográfica o una migración de base de datos. Un router que puntúa el mensaje actual de forma aislada ve una cadena muy corta sin vocabulario técnico, y hace lo obvio: modelo más barato.

Lo que significa que si rutas las solicitudes para ahorrar dinero, tu nivel más barato probablemente esté absorbiendo trabajo que nunca debería haber visto — y tu cifra de ahorro es en parte falsa. El 4 de agosto LiteLLM publicó un benchmark que mide ambas mitades de eso: qué tan mal se equivoca la ruta, y cuánto cuesta arreglarlo.

Desarrollo guiado por especificaciones: ¿es la solución al Vibe Coding?

· 14 min de lectura
Rafael Fernandes
NLP Engineer & Tech Writer at WiLine
Share:
Práctica de ingeniería · Noticias de IA

Desarrollo guiado por especificaciones, probado

Escribe el promptEscribe el contrato

Alguien publicó el desarrollo guiado por especificaciones en LinkedIn esta semana como la respuesta al vibe coding — a hacerle prompts a un agente, entendiendo a medias lo que estás construyendo, y terminar con código del que no puedes responder. El kit enlazado tiene 127.000 estrellas y viene de GitHub mismo. El argumento convence.

Así que lo instalé y lo apunté a una tarea deliberadamente trivial. Uno de los tres principios que escribió para mí fue una política de dependencias que nunca pedí — guarda ese pensamiento.

Veinte minutos no son un veredicto, sin embargo. Dos ingenieros lo han probado de verdad, en problemas reales, durante suficiente tiempo para que se vean las costuras. Usaron herramientas distintas, en continentes distintos, con siete meses de diferencia — y ambos recurrieron a la misma comparación, sin que nadie se lo pidiera: la última vez que nuestra industria intentó generar código funcional a partir de documentos. En la única pregunta que decide si algo de esto sobrevive al contacto con funcionalidades de IA, se contradicen rotundamente. Ninguno de los dos tiene una medición.

GPT-5.6: La nueva propuesta de OpenAI es más barata por tarea, no solo más inteligente — verifícalo en tu carga de trabajo antes de cambiar

· 12 min de lectura
Rafael Fernandes
NLP Engineer & Tech Writer at WiLine
Share:
Modelos · Noticias de IA

La carrera de frontera acaba de cambiar de carril: de más inteligente a más barato por tarea

Puntos de referenciaEconomía de tokens

OpenAI lanzó GPT-5.6 el 9 de julio — una familia de tres modelos (Luna, Terra, Sol) — y la afirmación principal no es una puntuación de tabla de clasificación. Es un número de eficiencia: rendimiento de codificación de frontera en menos de la mitad de los tokens de salida. Si construyes agentes, eso es una afirmación sobre tu factura, no sobre derechos de fanfarronear. También es exactamente el tipo de afirmación que deberías medir tú mismo.