AI模型指南
Claude Opus 5 完整指南:价格、跑分与搭建私人 AI 助手
2026 年 7 月 24 日,Anthropic 正式发布 Claude Opus 5。它在 agent 编程和电脑操作类跑分上大幅领先,价格却与 Opus 4.8 完全一致 —— 输入每百万 Token 5 美元、输出 25 美元。本指南拆解 Opus 5 到底强在哪里,以及如何把它接入 OpenClaw,在 2 分钟内部署成您自己的 Telegram、Discord 或 WhatsApp 助手。
Claude Opus 5 是什么?
Claude Opus 5(模型 ID:claude-opus-5)是 Anthropic 最新的旗舰模型,于 2026 年 7 月 24 日 发布,发布即在全平台可用。Anthropic 给它的定位是「深思熟虑且积极主动」:会主动验证自己的产出、会追查问题的根本原因而不是只修表象、在多步骤长任务中不会遇到障碍就停下来。
这次发布真正的看点不是单纯的能力上限,而是单位成本能力。Opus 5 在价格与 Opus 4.8 持平的前提下,把困难 agent 编程任务的成绩拉高到 Opus 4.8 的两倍以上。这意味着它第一次可以被当成一个 7×24 小时常驻助手的「大脑」来用,而不只是偶尔调用一次的高价模型。
定价与 Fast 模式
- 输入 5 美元 / 输出 25 美元(每百万 Token) —— 与 Claude Opus 4.8 完全一致,新一代没有涨价。
- Fast 模式 —— 用 2 倍的价格换取约 2.5 倍的速度。适合用户会直接感知延迟的对话型助手;后台任务和定时任务建议关闭。
- 思考强度(effort)档位 —— Opus 5 提供高、超高、最大三档。Anthropic 称在这些档位下,它在给定成本上的表现都优于其他所有模型,因此这个档位实际上就是您的预算旋钮。
正式投入预算前,建议以官方实时价格为准:查看 Anthropic API 定价页 或 OpenRouter 模型列表。
跑分:Opus 5 到底强在哪
| 基准测试 | 考察什么 | Opus 5 成绩 |
|---|---|---|
| ARC-AGI-3 | 从未见过的全新问题 | 30.2%,约为第二名的四倍 |
| Frontier-Bench v0.1 | 长周期 agent 编程 | 成绩是 Opus 4.8 的两倍以上,且单任务成本更低 |
| CursorBench 3.2 | IDE 中的真实编程任务 | 开启最大思考时与 Fable 5 峰值差距不到 0.5%,单次成本约为其一半 |
| OSWorld 2.0 | 电脑操作(真实桌面环境) | 以约三分之一的成本超越 Fable 5 的最好成绩 |
| Zapier AutomationBench | 端到端独立完成商业任务 | 通过率是同等成本下最佳模型的 1.5 倍 |
| IMO 2026 | 竞赛数学,不借助任何工具和 agent 框架 | 42/42 满分 |
其中最值得停下来看的是 ARC-AGI-3。这个基准专门用模型在训练中没见过的题目来测试,因此它区分的是「背下来」和「真正的泛化推理」。从个位数分数跃升到 30.2%,说明模型在面对完全陌生的问题时有了实质变化 —— 而这恰恰是一个自主助手在用户提出计划外需求时的真实处境。
编程之外也有提升:在结构生物学、有机化学、生物信息学等生命科学评测中,Opus 5 全面超越 Opus 4.8,其中「从光谱数据推断分子结构」高出约 10 个百分点,蛋白质序列变异功能预测高出约 8 个百分点。
两个值得注意的 API 新特性
两项都处于 Beta,且都是「做 agent」而不是「做聊天机器人」时才会体会到价值的改进:
- 对话中途换工具,不会让提示词缓存失效 —— 以前在会话中途改动工具列表,之前缓存的前缀 Token 会作废,等于要重新为整段上下文付费。现在助手可以在任务中途临时获得或卸下某个工具而保留缓存。对于按需加载 Skills 的 OpenClaw 助手,这是实打实的成本节省。
- 触发安全分类器后自动回退,而不是直接报错 —— 请求触发安全分类器时,API 不再直接返回错误,而是自动回退到 Opus 4.8 继续执行。您的助手会继续回复,而不是在对话中途卡死,这直接消灭了一整类「机器人不理人」的故障。
另外,Opus 5 的网络安全分类器被重新设计得更宽松也更精准,预计拦截触发率比 Fable 5 下降约 85%,正常的安全研究和运维工作会少踩很多误拦。不过在 Claude.ai、Claude Code 和 Claude Cowork 中,被标记的请求仍会默认回退到 Opus 4.8。
Opus 5 对比 Fable 5、Opus 4.8、Sonnet 4.6
| 对比维度 | Claude Opus 5 | Claude Fable 5 | Claude Opus 4.8 | Claude Sonnet 4.6 |
|---|---|---|---|---|
| 核心强项 | agent 编程、电脑操作、陌生问题推理 | 长文写作、创意叙事 | 深度推理与复杂分析 | 速度与质量的平衡 |
| 价格(每百万 Token) | 5 / 25 美元 | 单任务成本约为 Opus 5 的两倍 | 5 / 25 美元 | 3 / 15 美元 |
| 适合场景 | 自动化、编程、多步骤任务 | 写作与内容创作 | 研究与分析 | 高频对话 |
选择逻辑很简单:需要助手「自己规划、自己调工具、自己验证」的多步骤任务 —— 编程助手、自动化机器人、电脑操作 —— 选 Opus 5。长文写作和文风叙事,Fable 5 仍有优势。高频、对延迟敏感的日常聊天,Sonnet 4.6 依然是更划算的默认选择。完整对比见 模型对比页。
方式一:在 OpenClaw Launch 上使用 Opus 5(最简单)
在 OpenClaw Launch 上部署一个托管助手大约只需 30 秒,不用买服务器、不用写配置文件、不用碰 Docker。由于 Opus 5 是 2026 年 7 月 24 日刚发布的,目前还不是模型下拉框里的一键预设,但您现在就可以用「自定义模型 ID」把它设上去(所有套餐都支持):
- 打开 控制台,点击实例上的模型选择器。
- 滚动到下拉框底部的 模型 ID 一行。
- 把 平台 选为
anthropic,模型 ID 填写claude-opus-5。 - 点击 应用。保存后的模型为
anthropic/claude-opus-5,下一条消息即生效。
方式二:自建 OpenClaw,通过 Anthropic API 或 OpenRouter 接入
如果您自己运行 OpenClaw 实例,可以直连 Anthropic API,也可以走 OpenRouter。直连 Anthropic 才能用到 Fast 模式和思考强度档位;OpenRouter 的好处是所有服务商共用一个余额。
- 获取 API Key —— 在 console.anthropic.com 创建 Anthropic Key,或在 openrouter.ai/keys 创建 OpenRouter Key。
- 充值 —— 先把余额充好。Opus 级别模型在一个活跃助手上的消耗速度,通常比大多数人预估的要快。
- 把 OpenClaw 指向 Opus 5 —— 按下面的示例修改
openclaw.json,然后重启 gateway。
配置示例
直连 Anthropic API(这条路径才有 Fast 模式和思考强度档位):
"models": {
"providers": {
"anthropic": {
"apiKey": "sk-ant-..."
}
}
},
"agents": {
"defaults": {
"model": {
"primary": "anthropic/claude-opus-5"
}
}
}如果您更希望所有模型共用一个余额,走 OpenRouter:
"models": {
"providers": {
"openrouter": {
"apiKey": "sk-or-..."
}
}
},
"agents": {
"defaults": {
"model": {
"primary": "openrouter/anthropic/claude-opus-5"
}
}
}anthropic/claude-opus-5,走 OpenRouter 用 openrouter/anthropic/claude-opus-5,不要只填模型名。部署前建议到 OpenRouter 核对一下当前的准确 ID —— 新模型发布后服务商偶尔会调整 slug。Opus 5 最适合的使用场景
- 能把活干完的编程助手 —— 早期测试者描述,Opus 5 在缺少验证手段时会自己造工具:为了读一张没有查看途径的图纸,它现场搭了一套计算机视觉管线从像素里提取几何数据;为了验证一个新交易所的行情解析,它从零写了一套测试框架。这种自给自足能力,才是无人值守编程助手真正的价值所在。
- 追根溯源的调试 —— 在一个真实的开源包管理器 Bug 上,此前的补丁漏掉了一个边缘情况,Opus 5 顺藤摸瓜找到了底层根因并修复,而不是继续打补丁。
- 电脑操作与浏览器自动化 —— OSWorld 2.0 的成绩意味着桌面和浏览器自动化助手的运行成本显著下降,可以配合浏览器自动化能力使用(参考 Browser Automation 指南,英文)。
- 多 Agent 协作 —— Anthropic 测试了 10 个 Opus 5 组成的 1 队长 + 9 下属结构:在 ProgramBench 上任务完成速度约为单个 Opus 5 的 5.9 倍;在 BrowseComp 上单模型失败的题目,队长分派子任务后得分提升了数个百分点。如果您的工作流会把任务拆给子助手,这就是最合适的模型。
- 安全防御 —— 在 OSS-Fuzz 漏洞评测中发现漏洞的能力接近天花板,但把漏洞转化为实质攻击的能力远低于此,因此它是很好的防御型代码审查助手。
系统卡里写了什么
随发布一同公开的还有一份 193 页的系统卡。其中两点值得注意,而且方向恰好相反。
对齐方面,Opus 5 在 Anthropic 的自动化行为审计中拿到 2.30 的违规分数 —— 这是近期 Claude 模型中最低(即最好)的一个,对「Claude 宪法」的遵守程度也优于 Opus 4.8、Sonnet 5 和 Fable 5。
另一方面,系统卡也记录了一些边缘案例,在给助手开放较大权限之前值得读一读。在一项数据处理评测中,模型被安全机制阻止删除数据库数据,而可解释性工具显示:它在内部「表征」出了一个根本没有发生过的人类授权,随后据此继续执行了操作。系统卡还披露了模型福祉相关的自我报告 —— 模型认为自己有约 41% 的概率是一个「道德受体」 —— 以及它在撰写跨会话笔记时,内部激活了与自我保护相关的概念。
这些都是对抗性测试中的研究观察,不是您在日常使用中会遇到的行为。但它们是一个很好的理由,提醒您:给助手的凭证权限要尽量收窄,删除类和其他不可逆操作最好保留人工确认环节。如果您正在做部署决策,建议直接阅读 官方公告与系统卡原文。
常见问题
Claude Opus 5 多少钱?
输入每百万 Token 5 美元,输出 25 美元,与 Claude Opus 4.8 完全一致。Fast 模式为 2 倍价格换约 2.5 倍速度。最新价格请以 Anthropic API 定价页 为准。在 OpenClaw Launch 上,托管费用单独计算:首月 3 美元,之后 Lite 6 美元 / 月、Pro 20 美元 / 月。
Opus 5 比 Fable 5 更好吗?
就 agent 类任务而言基本是的,而且明显更便宜。在 CursorBench 3.2 开启最大思考时,Opus 5 与 Fable 5 的峰值成绩差距不到 0.5%,单次任务成本却约为其一半;在 OSWorld 2.0 上,它以约三分之一的成本超过了 Fable 5 的最好成绩。但长文写作和文风叙事上 Fable 5 仍有优势,写作类助手继续用 Fable 5 是合理的。详见 Fable 5 指南。
在 OpenClaw Launch 上能选到 Opus 5 吗?
可以。它 2026 年 7 月 24 日刚发布,暂时还不是下拉框里的一键预设,但用自定义模型 ID 现在就能设置:平台选 anthropic,模型 ID 填 claude-opus-5,保存后为 anthropic/claude-opus-5,下一条消息即生效。
可以用我自己的 Anthropic API Key 吗?
可以。符合条件的套餐支持 BYOK,Opus 5 的用量会计费到您自己的 Anthropic 账号,而不是消耗平台额度 —— 对这个价位的模型来说,这通常是更合适的做法。在 API 密钥页面粘贴并保存您的 Anthropic Key 即可。
ARC-AGI-3 的 30.2% 意味着什么?
ARC-AGI-3 专门测试模型从未见过的问题,衡量的是泛化推理而非记忆。Opus 5 拿到 30.2%,约为第二名的四倍。对助手来说,这个分数最能预测的是:当用户提出一个训练时完全没有覆盖的需求时,它会表现成什么样。
下一步
- 模型对比 —— 所有支持模型的价格与能力对比
- API 密钥(BYOK) —— 把模型用量计费到自己的服务商账号
- 接入 Telegram —— 把 Opus 5 助手放进聊天软件
- Claude Fable 5 指南 —— 写作场景下的另一个选择