Claude Opus 5发布:只给4句话,它自己干了8小时

未来先读 · AI 说明书

Claude Opus 5发布:只给4句话,它自己干了8小时

8小时、7万行代码、420万格地图。真正值得注意的,不是模型又多拿了几分,而是它开始自己检查、自己返工,把一件事持续往前推。

图片[1]-Claude Opus 5发布:只给4句话,它自己干了8小时 - AI资源导航站-AI资源导航站

Anthropic 在 7 月 24 日发布 Claude Opus 5。官方的说法很直白:它接近更高端的 Fable 5,但价格只有一半;在 Claude Max 里,它也已经成为默认模型。

不过,最能说明这次变化的,不是发布会上的排行榜,而是 Anthropic 首席产品官 Mike Krieger 分享的一次实测。

一条公开动态里的数字

4 句话 → 8 小时 → 7 万行代码
420 万格地图 → 6 秒内加载 → 60fps

Krieger 小时候喜欢《运输大亨》。他让 Opus 5 为旧存档做一个网页版 3D 浏览器,好让自己走进地图里,看列车照常运行。提示词只有四句话。

8 小时后,模型写出了约 7 万行代码:420 万格的世界能在 6 秒内加载,并保持 60 帧运行。更有意思的是,它还在没有被要求的情况下补上了昼夜循环。

这不是一场严格对照实验,而是负责人公开分享的单次案例,不能直接外推到所有任务。但它清楚地指向了一个变化:模型不再只等你把工作拆成十几步,而是能在较长时间里自己发现“下一步该做什么”。

▶ Claude 官方 8 秒发布视频 · X @claudeai

图片[2]-Claude Opus 5发布:只给4句话,它自己干了8小时 - AI资源导航站-AI资源导航站

01|它不是“写得更快”,而是“更会把活干完”

过去用 AI 做复杂项目,人的主要工作常常不是提需求,而是当项目经理:拆任务、催进度、对结果、找漏项,再把错误退回去重做。

Opus 5 想把其中一部分“脚手架”吸收到模型内部。Anthropic 给出的三个官方案例很有代表性:

看不到图,它先给自己造眼睛。任务要求根据机械零件图重建 FreeCAD 3D 模型,却故意不给模型直接看图的工具。Opus 5 先从原始像素写了一套视觉处理流程,再完成重建。

修 bug,不只盖住表面。面对一个流行开源包管理器的真实问题,它不仅找到根因,还补上了社区原修复遗漏的边缘情况。

没有真实数据,它先造测试台。为一家交易公司接入新交易所行情时,现场没有可用的实时 feed,模型便自己搭建测试工具,验证解析逻辑。

用更日常的话说:以前的 AI 像一个聪明但需要盯着的实习生;这次它更像会主动做复核的执行者。它仍然会犯错,但你不必为每一步都写成操作手册。

02|为什么“4句话”比跑分更重要

跑分告诉我们模型“能不能”,长任务案例才更接近现实里的“能不能交付”。这会影响的不只是程序员。

老师可以先给课程目标、学生水平和验收标准,让模型产出教案、练习与分层讲解,再要求它检查难度是否连贯。

内容创作者可以交付选题、受众和事实边界,让模型完成资料整理、结构、初稿与引用核对,而不是每一步重新对话。

创业团队则要重新审视产品护城河:如果产品价值主要来自“把模型包起来、多放几个代理互相检查”,底层模型正在吃掉这部分价值。真正难替代的,会更接近客户、私有上下文、可信流程和行业判断。

我们的编辑判断是:提示词没有消失,只是从“逐步遥控”转向“目标、边界和验收”。四句话之所以有效,不代表随便说四句话都有效;它说明,在目标足够清楚的任务上,模型开始承担更多过程管理。

03|更强,也更便宜,但要看“成功一次多少钱”

图片[3]-Claude Opus 5发布:只给4句话,它自己干了8小时 - AI资源导航站-AI资源导航站

Opus 5 的 API 定价与 Opus 4.8 相同:每百万输入 token 5 美元、输出 token 25 美元。Fast 模式约快 2.5 倍,价格翻倍。开发者还能从 low、medium、high、xhigh、max 五档 effort 中,选择更省 token,或让模型多想一会儿。

独立评测机构 Artificial Analysis 给出了更有用的补充:Opus 5(max)在其 Intelligence Index 得分 61,与 Fable 5 的 60 基本持平;但完成一项评测任务的平均成本是 2.03 美元,并不是所有较低 effort 档都占优。

所以别只看“每百万 token 多少钱”。对真正的工作,应该比较:完成一次合格任务用了多少轮、返工几次、人工接管多久,以及最后有没有通过验收。便宜但总失败的模型,往往最贵。

图片[4]-Claude Opus 5发布:只给4句话,它自己干了8小时 - AI资源导航站-AI资源导航站

04|别急着神化:它在事实问题上仍会自信犯错

同一份 Artificial Analysis 报告还有一个不那么好看的结果:在 AA-Omniscience 事实知识评测中,Opus 5 的准确率比 Opus 4.8 提高了 7 个百分点,但它在不确定时更愿意回答,幻觉率反而上升 14 个百分点,达到 50%。

这两个结果并不矛盾。一个模型可以更会规划、写代码和使用工具,同时仍会在事实缺口上给出听起来很完整的错误答案。尤其是医疗、法律、财务、新闻与公司信息,仍应要求一手来源,并让人检查关键结论。

另外,Anthropic 明确说明:Opus 5 在高风险双用途能力上仍落后于 Mythos 5,网络安全等特定请求可能被分类器拦截或回退到 Opus 4.8。自动回退能让流程不中断,却不会替你承担验收责任。

现在最值得试的一件事

挑一个真实、可回滚、已有人工答案的任务。只给目标、素材范围、禁区和验收标准,让 Opus 5 独立跑完;记录耗时、token、返工次数和人工接管点。不要先问“它是不是最强”,先问“它能不能在我的流程里稳定交付”。

最后

过去一年,我们习惯把大模型理解成“更聪明的聊天框”。Opus 5 给出的新信号是:前沿模型正在从回答问题,转向持续推进任务。

它还没有可靠到可以放任,也没有万能到四句话能解决所有问题。但当模型开始自己检查、自己纠错、自己寻找下一步,人的角色就会往上移动:定义什么值得做,什么绝不能做,以及怎样才算真正完成。

AI 开始替你推进工作以后,最稀缺的能力不是“会不会提问”,而是能不能说清目标、边界和验收。

有一个问题值得认真回答:如果 AI 已经能连续工作 8 小时,你最愿意交给它的第一件事是什么?又有哪一步,你无论如何都会坚持自己确认?

© 版权声明
THE END
喜欢就支持一下吧
点赞39 分享
评论 抢沙发
头像
欢迎您留下宝贵的见解!
提交
头像

昵称

取消
昵称表情代码图片