Evaluar agentes es más difícil que evaluar modelos (y por qué importa)
Un modelo se evalúa por respuesta. Un agente se evalúa por trayectoria: los pasos, las herramientas, el estado final. Cómo montar evals para sistemas que actúan.
Tag
6 artículos con este tag.
Un modelo se evalúa por respuesta. Un agente se evalúa por trayectoria: los pasos, las herramientas, el estado final. Cómo montar evals para sistemas que actúan.
El caching de prompts puede recortar coste y latencia a la mitad, pero solo si estructuras las peticiones para que el cache acierte. Guía práctica para devs.
Todo el mundo debate qué modelo es mejor. Casi nadie mide si el suyo funciona. Un argumento a favor de invertir en evaluación antes que en el último lanzamiento.
Desplegar un LLM sin observabilidad es volar a ciegas. Cómo instrumentar tus llamadas con estándares abiertos para saber qué pasa cuando algo falla.
Después de dos años de demos espectaculares, el discurso de los agentes autónomos empieza a chocar con la realidad de producción. Una reflexión sobre la brecha.
Montar un RAG es fácil. Saber si funciona es lo difícil. Un tutorial práctico para instrumentar la evaluación antes de que el sistema esté en producción.