完整公开时效 72h竞争度

那个 20 万星的 CLAUDE.md「进化」了:从 4 条规则到 10 条,开始教 agent 自我刹车

2026-06-28,一份署名 Andrej Karpathy、副标题为「A Short List of Rules, Earned by Watching the Same Mistakes Twice」的十条规则 CLAUDE.md 在 X 上开始流传(真实性未经本人确认,Karpathy 未回应)。它在社区四条版基础上新增六条,把重点从「怎么写代码」转向「agent 怎么监控自己的推理」:先写能复现 bug 的测试再修、调试时一次只改一个变量、把每个依赖当作长期负担、用「不确定就说不确定」替代「我觉得应该行」,并给出四种该立刻停手的失败模式——Kitchen Sink(让你修水龙头你把整个厨房翻新了)、Wrong Abstraction、Optimistic Path、Runaway Refactor。背景是社区四条版(开发者 Forrest Chang 据 Karpathy 1 月帖整理,repo forrestchang / multica-ai 的 andrej-karpathy-skills,两处合计 20 万+ stars,被称为 GitHub 史上增长最快的文件之一)。

搞着玩指数7.8
新奇度7.0
传播潜力8.0
国内可用8.5
标题模板、写作角度和公开核验来源,一份 Markdown 直接粘进你的编辑器。

推荐写作角度

  1. 实操向(写给天天用 Claude Code/Codex 的人):把十条规则逐条翻成中文 + 一份可直接粘进项目根目录的 CLAUDE.md 模板,重点讲「新增六条」在自动化/长跑 loop 里为什么比四条更值钱,并提醒只从官方 repo 取、警惕被投毒的 CLAUDE.md。
  2. 认知向(写给想理解「为什么一个文件能改变模型行为」的人):讲清 CLAUDE.md 是被注入到对话上下文(不是 system prompt)、因此是「影响而非强制」,由此解释为什么要给 agent 一套能自我识别失败模式的词汇,以及它和 /goal 独立验证模型的关系。
  3. 蹭热点/观点向:从「社区四条 vs 流传十条」的争论切入——内部工作文件该不该外泄、单个配置文件凭什么左右前沿模型——给中文读者一个有立场但克制的解读,附上「先别神化、自己 A/B 一下」的实操建议。

标题模板

  • 20 万星的 CLAUDE.md 又长大了:新增六条,开始教 AI 自己踩刹车
  • 让 agent 学会说「我不确定」:流传中的十条 Karpathy 规则全文解读
  • Kitchen Sink、Runaway Refactor:四种该让 AI 立刻停手的失败模式

公开核验来源

事实、判断、写作角度和标题模板全部免费公开;引用前请回到原始来源再次核对。

GitHub · andrej-karpathy-skills(社区四条版,含 CLAUDE.md 原文)Tech Times · 十条规则版报道与逐条解读

相关阅读

沿着这个问题继续读

全部选题卡
选题雷达窗口 72h竞争度

Muse Spark 1.3 上线:少 20% 工具调用是厂商结果,Max 推理与开放权重仍在路上

Meta 于 2026-09-02 发布 Muse Spark 1.3,并开始向 Muse Code 与 Meta Model API 推送;截至 Asia/Katmandu 2026-09-03 06:07,Hacker News 为 340 分、237 条评论。Meta 称相较 1.2,内部工程师比较中工具调用约少 20%、token 约少 25%,并强调长任务、多工作流、澄清问题与高后果操作前确认;这些数字来自厂商自测,没有公开证明所有语言、仓库和真实创作任务都能同比节省。边界必须前置:Max reasoning 仍要等额外安全测试,官方只说开放权重未来会来,两者都不是当前已交付能力;页面中的工程、音频和演示文稿案例是原型展示,不等于可复现产品验收。独立 Artificial Analysis 的首日数据也只是特定端点与基准快照,价格、速度和排名会变,中文创作者应以自己的任务集、隐私选项和完整成本复测。

搞着玩指数8.5
新奇度8.4
传播潜力8.9
国内可用8.2
完整角度标题模板
选题雷达窗口 1 周竞争度

Mistral 的训练退出不是一个总开关:Vibe、API 与反馈要分开检查

Mistral 本周更新数据治理帮助页,明确普通 Vibe 用户的输入输出默认可用于训练、可自行退出,Vibe Enterprise 则默认退出;Vibe 与 Mistral Studio/API 的退出开关彼此独立,关闭一处不会自动关闭另一处,上传文档也算输入数据。截至 Asia/Katmandu 2026-09-03 06:07,相关 Hacker News 讨论为 359 分、155 条评论。边界必须前置:帮助页描述的是当前产品设置,不等于历史数据自动删除、零数据保留或所有第三方接入都遵循同一规则;反馈渠道另有处理,官方提醒不希望反馈数据被用于改进时不要提交带评论的赞/踩。产品名称、套餐默认值和控制入口可能继续变化,发布前应按当日账号与合同复核,不能把“可退出”简化成“默认不训练”。

搞着玩指数8.9
新奇度8.8
传播潜力8.6
国内可用9.4
完整角度标题模板
选题雷达窗口 72h竞争度

21.5 万篇“最佳软件”页进入 AI 引用链:AEO 先要解决证据污染

Trellner Research 于 2026-09-02 公布一次 Perplexity 软件推荐审计:研究者用 380 个软件类别做单次快照,发现三个版式与基础设施高度相似的站点合计列出 215,128 个 `/best/` 购买指南;另一个软件厂商 Guideflow 的博客在 96 个类别中被引用 194 次,成为第三大引用来源。相关 Hacker News 讨论截至 Asia/Katmandu 2026-09-03 06:07 为 287 分、127 条评论。边界必须前置:研究只测 Perplexity、一个提示措辞、每类一次运行,两个模型档位的引用高度重合,不能当作两个独立实验;它没有证明这些页面一定错误、共同所有者是谁,也没有做移除来源后的因果测试,更不能外推 ChatGPT、Gemini、Copilot 或 Google AI Mode。215,128 是三站 sitemap 中对应 URL 数的合计,不是已人工逐篇判假的数量;“证据污染”应作为待复测风险,而不是给站点或运营者定罪。

搞着玩指数9.3
新奇度9.6
传播潜力9.2
国内可用9.0
完整角度标题模板
那个 20 万星的 CLAUDE.md「进化」了:从 4 条规则到 10 条,开始教 agent 自我刹车 - 选题卡 - 搞着玩