Evaluar agentes es más difícil que evaluar modelos (y por qué importa)
Un modelo se evalúa por respuesta. Un agente se evalúa por trayectoria: los pasos, las herramientas, el estado final. Cómo montar evals para sistemas que actúan.
Tag
6 artículos con este tag.
Un modelo se evalúa por respuesta. Un agente se evalúa por trayectoria: los pasos, las herramientas, el estado final. Cómo montar evals para sistemas que actúan.
El campo que intenta entender qué pasa realmente dentro de un modelo ha avanzado mucho. Un repaso accesible a los resultados que importan y a lo que aún no sabemos.
A mitad de año, hacemos balance de lo que cambió, lo que prometió y no cumplió, y dónde estamos realmente en el desarrollo de la inteligencia artificial.
Los LLMs olvidan todo al terminar cada conversación. Varias aproximaciones intentan resolver esto con resultados muy dispares. Estado del arte y qué funciona en producción.
El procesamiento de video por LLMs pasó de experimental a útil en casos específicos. Revisamos qué modelos pueden hacer con video, las limitaciones reales, y los casos de uso viables.
Chain-of-thought fue el primer paso. Ahora hay una familia de técnicas más sofisticadas para extraer razonamiento real de los modelos. Cuáles usar y cuándo.