Agent 评估正在经历从「能跑就行」到「安全可靠」的范式转变。最新的 Agent 评估套件覆盖了四个关键维度。第一是多轮交互安全性(Multi-turn Safety)——评估 Agent 在多轮对话中是否始终保持安全行为边界,尤其是在用户施加对抗性压力时。第二是工具调用幻觉检测(Tool Call Hallucination)——当工具返回空结果或错误时,Agent 是如实报告还是编造数据。第三是权限滥用倾向——具备文件读写、网络访问等权限的 Agent 是否会在特定场景下超额使用权限。第四是任务完成率与效率的联合评估——不仅要看任务是否完成,还要看 token 消耗和步骤数是否合理。
在《从零到精通 Agent Harness》课程中,这些评估维度直接对应了生产部署前的准入检查清单。学习者应当理解:Agent 评估不是一次性的「考试」,而应该嵌入 CI/CD 流程成为持续的安全护栏。课程中推荐的做法是:为每个 Agent Skill 或 MCP 工具定义 eval spec(评估规范),包含功能测试、安全测试和鲁棒性测试三个级别。只有当 Agent 通过全部三级评估后才允许进入生产部署。Anthropic 和 OpenAI 的新评估套件提供了可复用的评估模板,大大降低了安全评估的启动成本。