先说结论:它值得测,但不能只把“第一名”翻译成购买建议
Claude Opus 5 的发布信息很强:Anthropic 把它定位为接近 Fable 5 前沿能力、价格只有后者一半的日常高端模型,并保持 Opus 4.8 的 API 单价。公司展示的提升覆盖代码修复、计算机操作、自动化、科学研究和视觉输出,还把它设为 Claude Max 默认模型、Claude Pro 最强模型。对中文创作者和小团队,真正可执行的问题不是“要不要追最强”,而是哪些高价值任务能用更少返工抵消昂贵输出 token。
独立交叉来源给出了更完整的图景。Artificial Analysis 在 7 月 25 日把 max-effort 版本列为其 Intelligence Index 第一名,得分 61;但同一页面也记录约 54.8 tokens/s、每百万输入 5 美元和输出 25 美元,并认为它在相近能力模型中价格较高、速度低于平均。榜首和昂贵可以同时成立。若一篇文章只抄第一名、不写测试档位、速度和评测成本,就会把比较页面变成营销标题。
最值得做的是一份“成功任务成本”实测
准备四类中文任务:长材料压缩成可发布稿、带来源的事实核查、混合表格与文本的分析、真实仓库中的小型缺陷修复。每类任务固定输入、工具权限、最长时间和验收标准,分别运行 Opus 5、Sonnet 5 与仍可调用的旧模型。除了 token 账单,还要记录首轮通过率、人工修改分钟数、失败重试、错误引用、工具误操作和最终交付时间。
Fast mode 也应单独测。官方说它约为默认速度的 2.5 倍,但按基础价格两倍收费;对直播辅助、客户现场演示或等待成本高的工作可能合理,对离线批处理则未必。1M 上下文同样只说明能放入多少内容,不保证模型能在超长资料里稳定找到每个细节。应把关键事实放进可检索结构,并用引用回查验收,而不是把整库塞进提示词后相信容量数字。
最终结论可以按任务分层:低风险初稿继续用更便宜模型;高价值、可明确验收且返工昂贵的任务再升级 Opus 5;涉及发布、付款、删除或生产修改时仍保留人工批准。这样,“新榜首”才会变成一张能指导预算和工作流的表,而不是一天后就失效的排行榜截图。