本周精选
这周的主线不是“又一个模型赢了榜单”,而是 AI 与创作工具开始进入必须交代运行过程的阶段:谁调用了什么工具,日志里留下了什么,升级会破坏什么,数据到底去了哪里,失败后能不能恢复。下面 10 条按新奇度、传播潜力、国内可用性与事实可靠度综合排序;其中的官方数字、项目方基准和预印本结论都保留来源归属,不把资料整理写成实机测试。
- DeepSeek Harness 把整个 agent 外壳拆成插件,但现在仍是 0.1 阶段的开发者预览——选题卡:DeepSeek Harness 的插件与日志边界。模型、工具、skills、session、sandbox、storage、loop 和 UI 都可替换,append-only 事件流也让 resume、fork、search 与 replay 有了共同底座。真正值得跟的是“可组合、可复盘”的 agent 基础设施;边界是官方明确警告会有兼容性破坏,插件化不等于第三方插件可信,完整轨迹还可能集中保存 prompt、reasoning、源码、终端输出与凭据。
- SQLite 官方确认了一个至少跨越 16 年的极罕见 WAL-reset 数据竞态——选题卡:SQLite WAL-Reset bug 与正确修复版本。Tailscale 披露半年内 19 次损坏后,SQLite 用故障注入稳定复现;官方文档说明问题影响 3.7.0 至 3.51.2,3.51.3 已修复,而原先带修复的 3.52.0 因另一问题撤回。它适合写“低概率故障如何被规模放大”,不适合写成“SQLite 一用就坏”;升级也只能阻止新竞态,不能自动修好既有损坏。
- Gemini 3.7 Flash 已 GA,但“半价”有明确截止日,迁移也不只是换 ID——选题卡:Gemini 3.7 Flash 的价格与迁移边界。官方文档给出 1M 上下文、64K 最大文本输出和 low/medium/high 三档 thinking;$0.75 输入、$3.75 输出的百万 token 推广价到 2026 年 12 月 31 日结束,次日翻倍。旧项目还要移除部分 sampling 参数与预填充 model turn。GA 代表服务阶段,不代表中文任务、延迟、超时和返工成本已经替你验收。
- 研究者报告从公开的加密推理块中找回 182 份凭据——选题卡:加密推理轨迹也要按敏感数据处理。原始预印本称扫描 315,320 个 reasoning blocks,找回 367 项个人信息与 182 份凭据;最直接的行动是公开 coding-agent 日志、录像、JSONL、bug report 和数据集前,把 opaque reasoning/signature 字段也纳入脱敏与 secret scanning。数字来自尚未同行评审的作者实验,且作者披露后已不能用同一方法攻击,不能剪成今天仍有效的解密教程。
- Qwen3.8 首次开放官方称为 Max 级的 2.4T 权重,但 95B 激活不等于只需存 95B——选题卡:Qwen3.8 的近 4.9TB 权重与许可边界。模型索引列出 213 个 BF16 分片、总计约 4.892TB;可下载版是 text-only 且强制 thinking,视觉、默认 1M 上下文、非思考模式与内置工具属于云端 Max 的另一条产品线。官方跑分需要独立复现,自定义许可证也不能缩写成无条件 Apache/MIT 开源。
- AnyDoc 把多种 Office 文件在浏览器本地转成 Markdown,但扫描 PDF 仍需 OCR——选题卡:AnyDoc 的本地转换与基准边界。Rust 核心覆盖 Word、PowerPoint、Excel、OpenDocument、RTF、EPUB、CSV 与文本型 PDF,并提供 Node.js、Python 和 WASM;浏览器 demo 的文件不离开本机。官方“中位 4.4ms、质量 81 分”来自不可再分发语料与 LLM judge,应当作为项目方基准;图片型 PDF、复杂公式、图表语义、恶意压缩包和后续上传模型的数据流仍要单独检查。
- “AI 水印移除器”能验证部分元数据变化,却不能证明骗过官方检测——选题卡:C2PA、SynthID 与六栏验证法。项目可以检查 Unicode、EXIF/XMP 与部分 hard-bound C2PA,统计文本重写和像素水印处理则明确属于 best-effort 或外部后端。C2PA 2.4 规范允许用指纹或不可见水印的 soft binding 重新发现远端 manifest,因此文件内看不到凭证不等于来源链消失。只应用自有内容做隐私、转码耐久性和披露修复测试,不提供移除他人来源凭证的规避教程。
- Zed 想把 agent 对话、持续变化的代码与评审锚在同一段历史里——选题卡:Zed Delta 的实时协作与私测边界。DeltaDB 记录逐操作 delta,让评论在代码移动后仍能引用对应历史,Git 与 CI 继续保留。这个方向很适合做“接手者能否更快理解 AI 改动”的对照实验;但 Delta 仍是 private beta,定价、自托管、数据驻留、保留与大规模性能没有完整公开,敏感仓库不应只凭“线程默认私有”就上传。
- Mojo 1.0 终于让开发者可以认真讨论兼容性,但编译器开放和原生 Windows 仍未同时到位——选题卡:Mojo 1.0 的稳定、平台与许可证边界。1.0 收敛变量、闭包和 Pointer 表达,并改进 LSP 与内存安全诊断;官方系统要求仍写明 Windows 只能走 WSL,1.x 也可能以受控方式发生破坏性变化。标准库仓库许可、Mojo/MAX 使用分发条款和仍待开放的编译器工具链要分层说明,不能把“语言到 1.0”写成“整套生态已经毕业”。
- Sonic Pi v5 用 SuperSonic 重做了现场音频底层,插耳机不再必须重启音乐——选题卡:Sonic Pi v5 的演出与升级边界。官方发布确认可在 GUI 热切输入输出设备、采样率与 buffer,Linux 增加原生 PipeWire;窗口与主混音一键录制、Syphon/Spout GUI 流只在 macOS 和 Windows。它是本周最适合立即做演示的一条,但旧作品会受 volume 范围、limiter 和 FX 顺序变化影响,正式演出前必须复制项目、回放、记录听感差异并保留独立音频备份。
这周怎么用
这 10 条可以归成三条行动线。第一条是让 agent 工作可复盘,但别让日志变成新的秘密仓库;第二条是把升级写成迁移与恢复实验,而不是新品转述;第三条是把“本地、开放、已移除”这些绝对词拆成可验证的资源、数据和权利边界。每条路线都能用公开材料先做,不需要把选题、素材链、角度或复制简报藏进付费墙。
- 主线一(日志与权限):用一个完全脱敏的小仓库,对比 DeepSeek Harness 的事件流与现有 agent 日志,画出 system prompt、工具调用、源码、凭据和不透明 reasoning block 的流向;最后发布一张删除、轮换、最小权限和保留期限清单。
- 主线二(升级验收):从 SQLite 3.51.3、Gemini 3.7、Mojo 1.0 或 Sonic Pi v5 里选一个,固定旧版本、输入、成功标准与回滚点;分别记录只改版本号时的失败,以及按官方迁移清单修正后的结果,不把资料阅读包装成实测完成。
- 主线三(开放性账本):用 Qwen3.8、AnyDoc 和 C2PA 工具做三张表,分别列权重与算力、文件是否离机与 OCR、hard/soft binding 与检测器;每个结论只允许落在“官方声明、已复验、未运行、不可验证”四种状态之一。