「给 agent 立规矩,而不是换更大的模型」——Statewright 把状态机塞进 Claude Code,让小模型也能稳
在 Hacker News 的 Show HN 上 56 分、16 条讨论(作者 Ben Cochran,自述有 20+ 年工程经验、曾在 NVIDIA / AMD 任 Distinguished Engineer)。Statewright 的主张很反直觉:不靠更大模型或更长上下文,而用形式化状态机约束 agent——每个状态只开放特定工具、限定迭代次数和合法转移(规划态只读、实现态才给编辑工具、测试态只能跑测试命令),由协议而非 prompt 强制执行。作者称这让 13–20B 的小模型在 SWE-bench 类任务上稳定提升,连 Haiku / Sonnet / Opus 也更省 token、更少陷入「死循环」。核心是一个 Rust 引擎,通过 MCP 插件接入 Claude Code。
推荐写作角度
- 科普 / 认知向(写给所有觉得「agent 不稳」的人):讲明白为什么「把问题改小」常常比「把模型改大」更有效——用状态机约束工具与每步上下文,配 Statewright 的「规划 / 实现 / 测试」三态例子,让没接触过形式化方法的人也能懂。
- 动手向:「让你的 Claude Code 守规矩」——手把手用 Statewright 的 /plugin 装一个 bugfix 工作流,对比开启 / 关闭状态机时 agent 行为的差别,给读者一个能复现的小实验。
- 冷静 / 思辨向:聊它的争议点——research 复现代码尚未完全公开、核心引擎号称 Apache 2.0 但又提到已申请临时专利(#64/054,240,含 35 项权利要求),给想采用的人一份「这开源到底开了多少」的提醒。
标题模板
- 「别再堆大模型了:用状态机给 AI agent 立规矩,小模型也能稳」
- 「规划只读、实现才给改:Statewright 把「agent 守规矩」做成了协议」
- 「前 NVIDIA 工程师的反直觉实验:把问题改小,而不是把模型改大」
公开核验来源
事实、判断、写作角度和标题模板全部免费公开;引用前请回到原始来源再次核对。
GitHub · statewright/statewright(状态机护栏 + MCP 插件)Hacker News · Show HN 讨论(56 分 / 16 评论)官方 · Statewright 研究页与可视化编辑器相关阅读
沿着这个问题继续读
Codebase Memory MCP 是什么?AI 编程助手的代码图谱与长期记忆指南
Codebase Memory MCP 是一个本地运行的代码索引与知识图谱工具。项目自述支持 158 种语言、15 个 MCP 工具,并在 31 个真实仓库的预印本评测中报告 10 倍 token 降幅;它不内置大模型,而是给 Claude Code 等 MCP 客户端提供结构化代码上下文。
一套配置喂饱所有 coding agent:Everything Claude Code 把 Claude Code/Cursor/Codex/OpenCode 统一成一个「agent 操作系统」
独立开发者 Affaan Mustafa 的开源项目 Everything Claude Code(ECC)在约五个月内冲上 GitHub 高星榜——不同报道统计其 star 数在快速攀升(从 10 万、16.3 万、17 万一路到 21 万+,各来源口径不一),成为最受关注的 AI 开发工具仓库之一。它的核心不是又一个 agent,而是一层「agent harness / 配置操作系统」:用 AGENTS.md 放在仓库根目录的约定 + 跨平台 hook 适配器,让同一套配置同时驱动 Claude Code、Cursor、Codex、OpenCode(新版本还覆盖 Gemini、Zed),并内置大量现成 skills / agents / commands(报道口径从「28 agents、119 skills、60 commands」到新版「262 skills、64 agents、84 commands」不等)。还配了开源安全审计器 AgentShield(red-team/blue-team/auditor 流水线,官方称约 102 条静态规则、1282 个测试、98% 覆盖),用来扫 CLAUDE.md、.cursorrules、agents.json 等配置里的提示注入与 guardrail 漏洞。作者自 2025 年 2 月起每天用 Claude Code,2025 年 9 月凭这套优化系统拿下 Anthropic x Forum Ventures 黑客松。它改变的是「每个 agent 工具各配一套」的碎片化现状——把 agent 的「人设、技能、记忆、安全」标准化成一份可跨工具复用的配置。(抓取于 2026-07-04;star 数与各项数量因版本/来源不同差异较大,引用前请以打开当天的仓库为准。)
「越用越快的 AI agent」——Nous Research 的 Hermes Agent 把自我进化做进了运行时
Nous Research 的 Hermes Agent 是一个开源(MIT)、可自托管、模型无关的自主 agent,卖点是把「自我改进闭环」直接做进运行时:它不止完成任务,还会记住、把成功的做法编译成可复用的「技能」,越用越熟。其自我进化机制基于 GEPA(被报道为 ICLR 2026 Oral),据报道当 agent 积累 20 个以上自生成技能后,重复任务可快约 40%。据报道最新版本 v0.13.0(2026-05-07)累计 864 次提交、295 位社区贡献者,支持经 OpenRouter 等接入 200+ 模型,并集成 Discord / Slack 等消息渠道。(具体版本号与数字以官方仓库为准,发布前已附仓库链接供核实。)