先说结论:它值得测,但“开放权重”不等于普通电脑已经能跑
Hy4 preview 的看点不是单独某一张排行榜,而是模型规模、长上下文和真实生产任务被放进了同一次发布。官方称 770B 总参数中每个 token 激活 49B,并用内部软件工程、游戏、金融和安全专家参与构造任务。模型卡还给出 1M 上下文、工具调用、结构化输出、微调流程,以及 vLLM 和 SGLang 的推理配方。对做长资料整理、代码代理、演示文稿和小游戏的中文创作者,这确实是一组可以落到工作流里的能力主张。
但 49B 是每次计算激活的参数,不是需要保存的全部权重。官方 FP8 示例仍使用八路张量并行;能通过 API 调用与能在自己的工作站部署,是两种完全不同的成本结构。托管端也不能只看输入单价:默认 high reasoning 可能放大输出 token,长会话能否命中缓存、缓存保持多久、失败是否重试,都会改变最终账单。
最有价值的内容,是一份可复验的中文任务账本
先固定五类输入:有来源的新闻核查、十万字资料问答、带公式的表格、指定截图的前端还原、一个可玩的最小游戏。每类都定义成功标准,并同时记录首 token、总耗时、输入输出、缓存读取、工具调用、事实错误、视觉返工和人工分钟数。对照 Hy3 或另一款可用模型时,使用相同 harness、上下文和超时,避免把不同配置造成的差异归功于模型。
长上下文测试还要埋入可定位的矛盾、过期版本和无答案问题,检查模型是否真的检索到证据、会不会把不同文件拼成一个不存在的结论。游戏与前端任务则应保存可运行产物、截图和错误日志,不能只凭一次漂亮演示评分。
所有任务、来源、标题模板、成本公式、结果与失败样本都应免费公开。读者可向搞着玩实验室免费提交自己的中文任务集,共同扩充复测表;若需要处理用户自己的成本诊断、部署原型或固定范围 MVP,再单独界定付费交付物。