先说结论:它值得写的不是“自动发现科学”,而是把研究承诺变成可拒绝作弊的合同

PRAXIST 把常见的一次性 agent 提示,扩成多轮实验循环:多个研究 peer 尝试不同方向,统一 evaluator 把结果变成证据,保留下来的方案再影响下一代计划。这个结构对算法调参、模拟器策略、数据处理管线和有明确指标的工程优化都很诱人。但官方自己把入口条件写得很窄——项目必须已经能运行,目标必须可测,任务方要拥有基线、数据、约束与评价器。没有这些,系统不会凭空创造有效科学问题;有这些,也仍需证明评价器没有被候选钻空子。

中文创作者最适合先做一场小型公开复现。选一个十分钟内能跑完的任务,冻结数据和基线,给主指标规定方向,再加两条不可牺牲的约束。例如压缩图片体积时同时限制 SSIM 与处理时间,或者优化网页首屏时禁止删掉核心内容。先手工制造一个“分数变高但违反约束”的候选,观察 harness 会不会拒绝;再重复运行同一候选,检查结果、日志、随机种子和产物哈希是否一致。只有这两步通过,才值得增加 peers、generations 和模型预算。

成本表要和成绩表同时出现。至少记录宿主 OS、Python 版本、安装下载量与落盘量、模型供应商、每个 peer 的 token、缓存命中、并发、单次评价耗时、失败重试、生成数、总墙钟、总费用和手动干预次数。监视器关闭不代表后台 run 停止,长任务必须有预算上限、停止命令、磁盘配额和可恢复检查点。任何“提升 20%”都要附基线 SHA、候选 SHA、评价命令、重复次数、置信区间或方差,以及被拒绝候选的原因。

许可检查应在安装前完成。Fair Source 协议允许符合条件的内部使用和修改,但收入阈值按 licensee 与 affiliates 的全球总收入计算;公开生成输出的产品名署名、独立分发限制、商业许可协商时限和适用法律都可能影响公司采用。遥测在协议里被描述为单独明确 opt-in,不等于接受许可证就同意采集,但实测仍应抓出站请求并检查配置。所有来源、角度、标题、竞争度、时效窗口、评价表和复制简报都免费公开;读者可向搞着玩实验室免费提交自己的可度量研究题共同设计,付费只用于用户自己的 evaluator 诊断、实验原型或固定范围 MVP。