Nuevo paradigma de evaluación de agentes: de un solo benchmark a pruebas multidimensionales de alineación de seguridad

Anthropic y OpenAI han lanzado nuevos conjuntos de evaluación de agentes, expandiéndose de la precisión de finalización de código a seguridad de interacción multi-turno, alucinación de llamadas a herramientas y detección de abuso de permisos.

SafetyEvaluationBenchmarkingAlignment

La evaluación de agentes está experimentando un cambio de paradigma de 'funciona' a 'seguro y confiable'. Los nuevos conjuntos de evaluación cubren cuatro dimensiones clave: seguridad multi-turno, detección de alucinaciones en llamadas a herramientas, tendencia al abuso de permisos, y evaluación combinada de tasa de finalización y eficiencia.

En el curso Agent Harness de Cero a Experto, estas dimensiones de evaluación corresponden directamente a listas de verificación de aceptación previas al despliegue. La evaluación de agentes no es un 'examen' único sino un guardarraíl de seguridad continuo integrado en CI/CD.