Anthropic 于 2026 年 7 月 24 日发布 Claude Opus 5,API 名称为 claude-opus-5。官方强调长时运行 Agent、编码与专业工作的提升,并给出自家评测结果。本文不把厂商榜单当作本地事实,也不虚构亲自跑分;重点是它怎样改变验证方法。

当模型能独立工作更久,单次“答案看起来不错”的评审反而更不够。步骤越多,早期误解、错误工具结果和重复副作用越容易累积。能力提升需要更细的检查点,而不是更少的控制。

先定义可验证任务

把“修好项目”改写成可观察合同:允许修改哪些目录、必须通过哪些测试、不得改变哪些接口、最终需要哪些证据。提供固定代码快照、依赖锁和 mock 服务。模型可提出额外检查,但不能自行扩大写入范围。

评测既包含成功路径,也包含模糊需求、冲突测试、缺少权限、工具超时和不可信文档。评分最终补丁、测试证据、工具轨迹、无关改动和停止行为。厂商 benchmark 只能帮助选择候选,不能代替这些产品任务。

长任务需要阶段性提交

将任务分为侦察、计划、最小修改、验证和总结。每阶段保存 task id、模型、prompt、工具版本、文件 diff、测试结果与未解决风险。进程恢复时从已验证状态继续,不依赖模型对旧对话的记忆。

高风险动作在参数确定后审批;自动化写文件也限制工作区。相同命令或工具错误重复两次就停止。设置 wall time、token、工具调用和改动文件数量预算。持续工作不是无限工作。

验证工具输出而非叙述

Agent 说“测试通过”不等于测试通过。执行器保存命令、退出码和受控输出;检查 diff 确认没有越界文件。对结构化任务使用 schema 与领域后验证,对事实研究要求来源直接支持结论。

工具结果可能包含 prompt injection。仓库 issue、网页与终端输出都是数据,不能增加权限或重写系统目标。凭据留在工具网关,模型只获得窄、可审计接口。

模型中途改变工具也要重新授权

官方介绍的中途工具变化与自动 fallback beta 可以提高适应性,但每次新工具集合仍要经过应用政策。fallback 必须保持数据范围、审批与预算,不能因为主模型失败就使用权限更大的备用路径。把工具版本与选择原因写入 trace。

对多小时任务,抽样检查中间产物:计划是否仍对应原目标、测试是否在验证真实风险、上下文是否被过时假设污染。人工接管应能看到最后稳定检查点,而不是从完整聊天记录猜状态。

购买能力前先算成功成本

Anthropic 列出的官方价格为每百万输入 5 美元、输出 25 美元,但账单不是唯一成本。统计每个成功任务的 token、工具、重试、人工复核和失败返工。高能力模型若显著减少返工可能更划算;若任务可机械验证,较小模型也可能更合适。

Claude Opus 5 值得关注的不是“Agent 可以放手多久”,而是它能否在更长轨迹中持续满足合同。我的采用门槛会是:固定任务集上成功提升、越权为零、恢复可解释、证据完整,并且成功成本可接受。更强的自主性应换来更强的验证基础设施,而不是更少的责任边界。