先说结论:最强模型不必做最多工作,协调系统才是实验主角

Cursor 的新版系统把大任务组织成一棵树:规划 agent 负责拆目标和做设计决定,worker agent 只处理狭窄的叶子任务。实验最值得中文开发者和技术创作者关注的,不是“几百个 AI 一夜写完数据库”的戏剧化叙事,而是同一任务、同一时间预算下,不同模型分工产生了接近八倍的成本差距。

官方数据里,worker 至少消耗 69% 的 token,多数运行超过 90%。当昂贵模型同时承担规划和执行,细碎实现会持续吞掉高价 token;让前沿模型只消除关键歧义,再把明确任务交给更便宜的模型,账单可以大幅下降。不过,较贵的规划模型也未必总让总成本更高:若它写出的计划导致 worker 少走弯路,整体 token 反而可能更少。选型不能只比较单价,还要看返工和协调开销。

从一千次提交里学到的,是组织设计

旧系统曾出现大量冲突、重复设计和超大文件。新版把设计决定留给规划者,用共享文档记录约束,让中立 agent 处理合并冲突,并在热门文件膨胀时暂停新提交、先拆模块。Cursor 还组合多个相关性较低的 review 视角,因为单一审查者无法发现所有错误。

这些做法不要求小团队真的运行上千 agent。哪怕只有两个并行编码会话,也可以先划清文件所有权,把跨模块决定写入共享设计文档,指定一个独立会话只做冲突合并,再用测试和静态检查作为不可绕过的门。可复用的是边界和反馈回路,不是 agent 数量。

怎样把厂商实验写得准确

内容中应把“Cursor 报告”“公开仓库可见”“社区讨论认为”分开。四组新版运行最终通过测试,是厂商报告的实验结果;是否能被第三方用相同模型、提示、预算和基础设施复现,目前没有证据。公开仓库可以帮助检查实现范围,却不能替代独立基准,而且仓库页面没有显示许可证,不能因为代码可见就默认可用于商业项目。

这次实验更稳妥的结论是:在长时程软件任务里,模型能力只是成本函数的一部分,任务分解、共享记忆、冲突解决和多视角审查可能更重要。对普通创作者而言,先把规格写清、把高价模型留给真正含糊的决策、给便宜执行层设置测试门,比盲目增加 agent 数量更接近可落地的收益。