Agent 评估新范式:从单一基准到多维度安全对齐评测框架
Anthropic 和 OpenAI 分别发布了新的 Agent 评估套件,从简单的代码完成准确率扩展到多轮交互安全、工具调用幻觉、权限滥用检测等维度。Agent eval 进入安全对齐评测时代。
从 X 上公开讨论中筛选 Codex、Agent Harness、记忆、工具、安全和工程化趋势,整理成多语言 SEO 内容。
Anthropic 和 OpenAI 分别发布了新的 Agent 评估套件,从简单的代码完成准确率扩展到多轮交互安全、工具调用幻觉、权限滥用检测等维度。Agent eval 进入安全对齐评测时代。
A2A 协议从草案进入生产验证阶段,Google、Anthropic 和多家企业发布生产级 A2A 实现。Agent 之间通过标准化卡片(Agent Card)发现彼此能力,实现跨平台任务委托与协作。
Agentic RAG 从简单「检索→回答」流程进化为 Agent 自主决定何时检索、检索什么、如何评估检索结果以及是否需要二次检索的多步推理模式。LangGraph、LlamaIndex 等框架提供生产级实现。
Codex CLI 的会话管理机制(continued session)是 Agent 工程化中状态持久化的典型案例。分析其 session 生命周期、上下文窗口管理和状态检查点设计,对构建生产级 Agent 交互系统有直接参考意义。
MCP 生态正在构建从传输层到工具层的多层安全模型,包括沙箱执行隔离、逐工具权限声明、调用审计日志和速率限制。这些安全机制是 MCP 从开发工具走向企业基础设施的关键前提。
OpenTelemetry 社区发布 Agent 可观测性扩展,支持端到端的 Agent 调用链追踪(从用户请求到工具调用再到模型响应)、逐工具耗时分析和 Agent 决策路径可视化。Agent 调试从 print 日志进入结构化观测时代。
Agent 系统的上下文窗口管理从简单滑动窗口进化为多层级压缩策略,包括关键帧保留、语义摘要和结构化状态压缩。Claude Code、Codex CLI 和 Gemini CLI 各自实现了不同的 token 预算分配方案。
PR Review Agent 从简单的 Lint 检查进化为具备代码语义理解、变更影响分析和上下文感知建议能力的工程工具。OpenHands、CodeRabbit 等工具展示了 Agent 在代码质量保障中的新型应用范式。
多 Agent 编排从手写工作流进化为四种通用架构模式:顺序管道、路由分发、广播聚合和网状协作。每种模式适用于不同的业务场景,Harness 设计者需要根据任务特性选择或组合使用。
Agent 自我修正能力从简单重试进化为多阶段自省流程:错误检测→根因分析→修复方案→验证确认。Claude Code 和 Codex CLI 分别实现了不同的自省与恢复机制,显著提升了 Agent 任务成功率。