Get the latest on AI, LLMs & developer tools
New MCP servers, model updates, and guides like this one — delivered weekly.
它是什么
Claude Opus 4.8 是 Anthropic 最新发布的通用 Opus 模型。官方文档将其描述为公司在复杂推理、长周期代理编码和高自主性工作方面能力最强的模型。简而言之:此版本旨在处理那些模型必须保持状态、使用工具、检查自身工作并持续运行超过普通对话轮次的任务。
模型 ID 为 claude-opus-4-8文档显示,Claude API、Amazon Bedrock 和 Vertex AI 提供 1M token 的上下文窗口,而 Microsoft Foundry 在发布时提供 200k token 的上下文窗口。Messages API 的最大同步输出为 128k tokens。
Model: Claude Opus 4.8 API ID: claude-opus-4-8 Context: 1M tokens on Claude API, Bedrock, Vertex AI Output: 128k tokens on synchronous Messages API Default effort: high Regular API: $5 input / $25 output per MTok Fast mode: $10 input / $50 output per MTok
官方公告
此次发布始于 X 平台上的 Claude 官方账号以及 Anthropic 的发布文章。其核心主张明确:Opus 4.8 在 Opus 4.7 的基础上进行了升级,具备更敏锐的判断力、对自身进展更诚实的反馈,以及更长时间的独立工作能力。
隆重推出 Claude Opus 4.8:它在 Opus 4.7 的基础上进行了升级,具备更敏锐的判断力、对自身进展更诚实的反馈,以及比前代产品更长时间的独立工作能力。
— Claude (@claudeai)2026年5月28日
即日起以相同价格提供。 pic.twitter.com/EufxL7T1kb
Anthropic 的发布文章还补充了三项相关的产品变更:claude.ai 和 Cowork 中的工作量控制(effort control)、Claude Code 中的动态工作流(dynamic workflows),以及 Opus 4.8 的快速模式(fast mode)。这一点至关重要,因为此次模型发布不仅仅是简单的版本替换,它改变了开发者设置工作量、缓存提示词(prompts)以及构建长周期 Agent 运行任务的方式。
基准测试表
Anthropic 的系统卡片提供了最有参考价值的验证表。下表数据直接摘自官方系统卡片,应将其视为部署前的评估结果,而非保证每个生产工作负载都能获得同等幅度的性能提升。
| 评估指标 | Opus 4.8 | Opus 4.7 | 注意事项 |
|---|---|---|---|
| SWE-bench Verified | 88.6 | 87.6 | 在已验证的真实 GitHub 问题上表现有小幅提升。 |
| SWE-bench Pro | 69.2 | 64.3 | 来自 ClaudeDevs 讨论帖中显著的编码能力提升。 |
| Terminal-Bench 2.1 | 74.6 | 66.1 | 在命令行智能体任务上取得了显著进展。 |
| OSWorld-Verified | 83.4 | 82.8 | 在真实的 Ubuntu 计算机使用任务上取得了小幅提升。 |
| GraphWalks BFS 256K | 85.9 | 76.9 | 长上下文图遍历能力大幅提升。 |
| GraphWalks Parents 256K | 99.3 | 93.6 | 强大的长上下文状态追踪结果。 |
系统卡片还显示,claude-opus-4-8 在 FrontierSWE 基准测试中,无论是 mean@5 还是 best@5 指标均排名第一。该基准测试为每个任务提供 20 小时的处理时间,这与 Anthropic 的定位相吻合:即该版本在处理耗时长、复杂且依赖大量工具的任务时表现最为出色。
更新内容
对于开发者而言,最重要的变化并非外观上的调整。Opus 4.8 默认启用 high 在所有界面上的努力,支持对话中途的系统消息,将最小 prompt-cache 长度降低至 1,024 tokens,并保留了 Opus 4.7 在采样和思考方面的限制。如果您的请求仍发送 temperature, top_p, top_k 或使用非默认值,Messages API 将会拒绝该请求。
Opus 4.8 同样不支持手动扩展思考预算。请使用自适应思考配合 thinking: {type: "adaptive"},然后通过 output_config.effort控制深度。Anthropic 建议在编码和 xhigh 代理任务中使用 high ,对于大多数对智能要求较高的任务,默认使用该模型。
client.messages.create({
model: "claude-opus-4-8",
max_tokens: 64000,
thinking: { type: "adaptive" },
output_config: { effort: "xhigh" },
messages: [{ role: "user", content: "Audit this migration plan." }]
})定价
Opus 4.8 的常规 API 定价与 Opus 4.7 保持一致:输入 tokens 每百万 5 美元,输出 tokens 每百万 25 美元。Opus 4.8 的快速模式比之前 Opus 模型的快速模式更便宜:发布文章中列出的价格为输入 tokens 每百万 10 美元,输出 tokens 每百万 50 美元。
实际解读很简单。标准模式是长时自主工作的默认选择。快速模式适用于对延迟敏感的交互、实时调试以及需要通过支付更高费用来换取输出速度的快速迭代场景。
安全说明
The official system card is not pure launch marketing. It says Opus 4.8 improves over Opus 4.7 on most alignment measures and is much less likely to leave flaws in its own code unreported. The launch post summarizes that as roughly four times less likely than Opus 4.7 to let flaws in written code pass unremarked.
同一份系统卡片也提出了一个注意事项:在增加额外防护措施之前,Opus 4.8 在某些代理提示词注入场景下的稳健性略低于 Opus 4.7。Anthropic 表示,已部署的防护措施在实践中弥补了这一差距。如果您正在构建一个会读取不可信网页、电子邮件、工单或仓库内容的代理,请将此注意事项纳入您的威胁模型中。
适用人群
在进行长时编码会话、仓库级重构、深度代码审查、专业文档分析、多源研究以及需要在多次工具调用中保持稳定规划的代理循环时,请优先使用 Opus 4.8。当延迟、成本或高吞吐量比极致的推理质量更重要时,请使用 Sonnet 或 Haiku。
结论很明确:Opus 4.8 并非一个颠覆性的新产品类别。它是一个在 Opus 原本擅长的领域——高难度工程任务、长上下文处理以及需要在出错前承认不确定性的代理任务——表现更出色的 Opus 版本。
迁移说明
- 将模型字符串更新为
claude-opus-4-8。 - 如果你仍在传递非默认的采样参数,请将其移除。
- 使用自适应思维(adaptive thinking),而非手动设置
budget_tokens。 - 针对生产环境的工作负载,请显式设置 effort。
- 移除 Claude API、Bedrock 和 Vertex AI 上旧的 1M-context beta 请求头。
- 对于长时间运行的测试工具(harnesses),请考虑使用对话中途的系统消息。
- 由于 effort 等级已变更,请重新评估成本和延迟基准。
FAQ
什么是 Claude Opus 4.8?
Claude Opus 4.8 是 Anthropic 于 2026 年 5 月 28 日发布的最新通用 Opus 模型。Anthropic 将其定位为适用于复杂推理、长周期智能体编码及高自主性任务的模型。
Claude Opus 4.8 的 API 模型 ID 是什么?
Claude API 模型 ID 为 claude-opus-4-8。Anthropic 同时列出了适用于 Vertex AI 和 AWS 上 Claude Platform 的对应官方 ID,以及 Bedrock 专用的 ID 格式。
Claude Opus 4.8 的价格是多少?
常规 API 使用费用与 Opus 4.7 保持一致:输入 token 每百万 5 美元,输出 token 每百万 25 美元。Opus 4.8 的快速模式(Fast mode)费用为输入 token 每百万 10 美元,输出 token 每百万 50 美元。
Opus 4.8 对开发者而言最大的变化是什么?
平台层面最大的变化包括:默认开启高努力模式(high effort)、Claude API 默认支持 1M 上下文、自适应思维(adaptive thinking)、对话中途系统消息(mid-conversation system messages)、更低的 prompt-cache 最低限制,以及更好的长上下文恢复能力。
Claude Opus 4.8 比 Opus 4.7 更强吗?
Anthropic 将其称为一次适度但切实的提升。系统卡(system card)显示,它在大多数能力评估中均取得了高于 Opus 4.7 的分数,包括 SWE-bench Pro、Terminal-Bench 2.1 和 GraphWalks。
官方来源
- Anthropic:介绍 Claude Opus 4.8
- Anthropic:Claude Opus 4.8 系统卡(System Card)
- Claude 文档:Claude Opus 4.8 的新功能
- Claude 文档:模型概览
- X 上的 Claude 官方发布帖
- X 上的 ClaudeDevs 官方开发者帖
相关内容: Claude Code 动态工作流指南 以及 Opus 4.8 API 迁移指南.
