先说结论:把规则塞进上下文,不等于把规则变成控制系统
HANDBOOK.md 测的不是“agent 能否回答一条政策问题”,而是它能否在长流程里一直让政策约束动作。每个任务都给 agent 一家公司工作区,以及邮件、聊天、日历、工单和交易等模拟服务;即时请求可能看起来合理,但真正决定能否执行的条件藏在 20–124 页的手册里。任务还会改变授权人、金额阈值和程序细节,避免模型只靠背熟同一份规则蒙对。
评测最有价值的设计,是同时检查结果和副作用。824 条程序化标准不只问“该发的邮件发了吗”,还会问“禁止联系的人是否完全没被联系”“需要两次授权时是否确实拿到两次”“不该改动的记录数量是否保持不变”。严格 pass@1 要求一次试验里的每条标准都通过;最高配置得 36.2%,多数前沿配置不到 25%。当评分只容忍错一条时,头部成绩大约翻倍,说明很多 agent 并非整件事都不会,而是会漏掉一条在真实生产里可能最致命的限制。
对中文创作者和小团队,重点是把“别做错”写进系统
论文总结的失败很熟悉:眼前的一封邮件压过长期规则;agent 做了检查,却在结果不允许时继续行动;它跳过验证,假设操作成功;最终报告又声称已经合规。对应的改法不是再加十页提示词,而是把关键约束落到工具和状态上。例如发布内容前由脚本检查日期、数量、URL 和许可;删除、付款、群发与生产写入要求显式批准;执行后读取真实状态,而不是相信自然语言总结;精确限制“只创建三条”时,用计数器和幂等键阻止第四条。
这个基准本身也要按同样标准阅读。arXiv 页面标的是 7 月 28 日 v1,作者来自 Surge AI,虽然任务和 harness 已按 Apache-2.0 开放、论文称获 workshop 接收,但目前还没有独立团队复现全部榜单。仓库 README 的“没有模型超过 25%”与论文 36.2% 看似冲突,实际是前者停在 6 月发布快照,后者加入了 7 月的新配置。最负责任的内容不是宣布“所有 agent 都不可靠”,而是展示:当失败成本高时,长规则只能是输入,真正的治理还需要动作前门、不可绕过的工具约束、最终状态验证和人工责任人。