同一周,国产开源把编程榜「顶」上去了——GLM-5.2 用 1/6 的价钱逼平闭源前沿
智谱 Z.ai 于 2026-06-13 发布 GLM-5.2,开源权重(MIT)于 2026-06-16 在 Hugging Face 正式放出。它是 744B 参数的 MoE 模型,每 token 激活约 40B,上下文窗口扩到 100 万 token(约为 GLM-5.1 ~20 万的 5 倍),最大输出 131,072 token。第三方测评把它列为当前最强开源权重编程模型之一:SWE-bench Pro 62.1、Terminal-Bench 2.1 81.0(仅次于 Claude Opus 4.8)。VentureBeat 报道其在多项「长时程」编程基准上超过 GPT-5.5,而 API 价格仅约其 1/6(约 $4.40/百万输出 token)。这恰好发生在 Claude Fable 5 因美国出口管制对外国人停用的同一周——对中文创作者,这是一个「现在就能下载、能跑、能商用」的现实选项。
推荐写作角度
- 上手/实测向(写给想省钱跑 agent 的开发者):写一篇「用 GLM-5.2 跑一个仓库级编程任务」的实录,验证 1M 上下文 + 81.0 Terminal-Bench 到底好不好用,诚实记录翻车点和与闭源模型的体感差距。
- 选型/省钱向:把「闭源前沿被切断 + 开源权重逼平」这条主线讲清楚,做一张「2026 年 6 月中文创作者能用的开源编程模型对照表」(GLM-5.2 / DeepSeek V4 / Qwen3-Coder-Next),用价格和分数帮读者选。
- 时代叙事向(写给关注国产 AI 的人):把 GLM-5.2 的「MIT 开源 + 登顶开源榜 + 1/6 价格」放进「这一轮中国实验室用开源权重正面刚闭源」的脉络里,但用真实分数说话,不吹不黑。
标题模板
- 「闭源刚被关掉,开源就登顶:GLM-5.2 把编程榜顶上去用了多少钱」
- 「100 万上下文 + MIT 开源 + 1/6 价格:GLM-5.2 到底强在哪、弱在哪」
- 「你用不到 Fable 5,但能下载 GLM-5.2:一份能立刻动手的开源编程选型」
公开核验来源
事实、判断、写作角度和标题模板全部免费公开;引用前请回到原始来源再次核对。
VentureBeat · GLM-5.2 多项长时程编程基准超 GPT-5.5,价格仅 1/6TestingCatalog · Z.ai 发布 GLM-5.2 开源模型,1M 上下文CodingFleet · GLM-5.2 vs GLM-5.1 详细对比(1M 上下文 / 双思考 / +28 DeepSWE)相关阅读
沿着这个问题继续读
Muse Spark 1.3 上线:少 20% 工具调用是厂商结果,Max 推理与开放权重仍在路上
Meta 于 2026-09-02 发布 Muse Spark 1.3,并开始向 Muse Code 与 Meta Model API 推送;截至 Asia/Katmandu 2026-09-03 06:07,Hacker News 为 340 分、237 条评论。Meta 称相较 1.2,内部工程师比较中工具调用约少 20%、token 约少 25%,并强调长任务、多工作流、澄清问题与高后果操作前确认;这些数字来自厂商自测,没有公开证明所有语言、仓库和真实创作任务都能同比节省。边界必须前置:Max reasoning 仍要等额外安全测试,官方只说开放权重未来会来,两者都不是当前已交付能力;页面中的工程、音频和演示文稿案例是原型展示,不等于可复现产品验收。独立 Artificial Analysis 的首日数据也只是特定端点与基准快照,价格、速度和排名会变,中文创作者应以自己的任务集、隐私选项和完整成本复测。
Mistral 的训练退出不是一个总开关:Vibe、API 与反馈要分开检查
Mistral 本周更新数据治理帮助页,明确普通 Vibe 用户的输入输出默认可用于训练、可自行退出,Vibe Enterprise 则默认退出;Vibe 与 Mistral Studio/API 的退出开关彼此独立,关闭一处不会自动关闭另一处,上传文档也算输入数据。截至 Asia/Katmandu 2026-09-03 06:07,相关 Hacker News 讨论为 359 分、155 条评论。边界必须前置:帮助页描述的是当前产品设置,不等于历史数据自动删除、零数据保留或所有第三方接入都遵循同一规则;反馈渠道另有处理,官方提醒不希望反馈数据被用于改进时不要提交带评论的赞/踩。产品名称、套餐默认值和控制入口可能继续变化,发布前应按当日账号与合同复核,不能把“可退出”简化成“默认不训练”。
21.5 万篇“最佳软件”页进入 AI 引用链:AEO 先要解决证据污染
Trellner Research 于 2026-09-02 公布一次 Perplexity 软件推荐审计:研究者用 380 个软件类别做单次快照,发现三个版式与基础设施高度相似的站点合计列出 215,128 个 `/best/` 购买指南;另一个软件厂商 Guideflow 的博客在 96 个类别中被引用 194 次,成为第三大引用来源。相关 Hacker News 讨论截至 Asia/Katmandu 2026-09-03 06:07 为 287 分、127 条评论。边界必须前置:研究只测 Perplexity、一个提示措辞、每类一次运行,两个模型档位的引用高度重合,不能当作两个独立实验;它没有证明这些页面一定错误、共同所有者是谁,也没有做移除来源后的因果测试,更不能外推 ChatGPT、Gemini、Copilot 或 Google AI Mode。215,128 是三站 sitemap 中对应 URL 数的合计,不是已人工逐篇判假的数量;“证据污染”应作为待复测风险,而不是给站点或运营者定罪。