模型发布官方来源

Muse Spark 1.3 完整指南

Meta 的旗舰模型在长时程智能体与编程任务上迎来迄今最大跃升:11 项基准对比、MRCR 98.5、DeepSWE 75.4、Terminal-Bench 88.8,以及新的智能体协作行为。本文基于官方博客、评测方法论文档与 API 文档,逐项拆解。

Muse Spark 1.3 指南封面:深色背景中一颗发光的火花状模型核心,向代码编辑器轨道喷薄而出。
插图:火花状的模型核心向代码编辑器轨道释放能量。

Muse Spark 1.3 是 Meta 于 2026 年 9 月 2 日发布的旗舰推理模型更新,主打长时程智能体工作与编程:MRCR 长上下文检索 98.5,DeepSWE 75.4,Terminal-Bench 2.1 达 88.8(与 GPT-5.6 Sol 持平)。扎克伯格称其为 “the biggest jump we’ve made so far on coding and agentic work”,并预告 Muse Spark 权重即将开放。

本指南基于 Meta 官方发布博客1.3 评测方法论文档Meta API 定价页,并对照扎克伯格与 @AIatMeta 的发布推文逐一核对数字。

Meta 发布了什么

Muse Spark 1.3 是 Muse Spark 系列的第三次旗舰迭代。发布节奏为:4 月首秀 Muse Spark,7 月 9 日 1.1,8 月 5 日 1.2,今天是 1.3——旗舰模型大约每四周一次的持续迭代。

官方博客将 1.3 的改进聚焦在三个方向:在单个对话线程内跨多个工作流完成更长时程的工作更主动的协作行为;以及对自身能力边界的更好校准。模型通过 Muse Code 和 Meta API 提供。

扎克伯格的发布帖

扎克伯格的帖子一小时内浏览量超过 21 万,其中有两点值得认真对待:

第一是定价语言:“too cheap to meter”(几乎便宜到无需计量)直接呼应 1.3 与 1.2 共享同一 API 定价——每百万 token 缓存输入 $0.15、输入 $1.25、输出 $4.25。第二是路线图:预告了两个发布,一个以 🍉 暗示,一个是 Muse Spark 开放权重。帖子附带的官方基准表是下一节的主题。

官方基准表

以下是 Meta 官方基准表的完整数字,配置在表头注明(Muse Spark 1.3 使用 max 推理强度,1.2 使用 xhigh,GPT-5.6 Sol 使用 max,Opus 5 使用 max):

Meta 官方基准表:Muse Spark 1.3 与 1.2、GPT-5.6 Sol、Opus 5 在 Agent、Long Context、Coding 三组共 11 项基准上的对比。
Meta 官方基准表(智能体、长上下文、编程三组)。来源:扎克伯格发布帖
基准Muse Spark 1.31.2GPT-5.6 SolOpus 5
GDPVal-AA v2(知识工作,Elo)1754161517101824
JobBench(专业工具使用)64.961.645.465.7
OSWorld 2.0(智能体计算机使用)66.947.662.768.3
DeepSearchQA(智能体浏览)89.485.993.090.4
Agentic IF Index(内部指令遵循)57.846.260.559.1
AutomationBench(端到端业务工作流)49.438.246.750.3
MRCR 256K–512K(长上下文)98.566.391.5
MRCR 512K–1M(长上下文)98.155.573.8
DeepSWE v1.1(长时程智能体编程)75.455.073.074.0
SWEAtlas CodeBase QnA(代码库理解)59.446.253.552.7
Terminal-Bench 2.1(智能体终端编程)88.882.988.886.7

阅读:1.3 在 11 项基准中的 5 项上取得或并列第一(两项 MRCR、DeepSWE、SWEAtlas、Terminal-Bench 并列)。Opus 5 在需要较强世界知识或计算机使用的任务上保持领先;GPT-5.6 Sol 在智能体浏览上领先。

六个最重要的数字

数字含义为什么重要
MRCR 98.5 / 98.1在 256K–512K 与 512K–1M 区间的多轮共指消解准确率接近完美的检索精度延伸到百万 token 上下文;1.2 仅为 66.3/55.5
DeepSWE 75.4长时程智能体编程任务 pass@11.3 相比 1.2 的 55.0 提升 20.4 分;超过 GPT-5.6 Sol(73.0)与 Opus 5(74.0)
Terminal-Bench 88.8智能体终端编程 pass@1与 GPT-5.6 Sol 并列第一;1.2 为 82.9
约 20% 更少工具调用与 1.2 的内部对比更少的循环步骤即更低的延迟与成本
约 25% 更少 token与 1.2 的内部对比同等任务下更便宜的智能体运行
$1.25 / $4.25每百万 token 输入 / 输出与 1.2 相同的定价——能力提升但价格未变

智能体协作改进

发布帖中最值得开发者关注的变化是协作行为的三个转变:

行为1.2 及更早1.3 的新行为
长时程工作容易在多步任务中途丢失目标在单个线程内跨多个工作流持续推进
主动协作通常静默假设并继续执行提出澄清问题;标记卡住状态;在执行重要操作前确认
边界校准倾向于虚构结果而非承认不确定对自身局限有更好的校准,不再“hallucinating outcomes”

这三项与效率数据相印证:工具调用减少约 20%、token 减少约 25%——更少的浪费性循环,更诚实的进度汇报,更高的单线程完成率。

发布节奏与产品接入

版本日期接入方式
Muse Spark2026 年 4 月Meta API、Meta AI
Muse Spark 1.12026 年 7 月 9 日Meta API、Meta AI
Muse Spark 1.22026 年 8 月 5 日Meta API、Meta AI、Muse Code
Muse Spark 1.32026 年 9 月 2 日Meta API(muse-spark-1.3)、Muse Code

API:模型 ID 与定价

1.3 以 muse-spark-1.3 提供,并带数据许可变体 muse-spark-1.3-contributor。按 官方定价页,Standard 层覆盖 muse-spark-1.3muse-spark-1.2muse-spark-1.1,三者共享同一价格表:

层级缓存输入输入输出说明
Standard$0.15$1.25$4.25提示与补全不用于训练 Meta 模型
Contributor$0.002$0.10$0.20大幅折扣,交换条件是允许用你的数据训练

速率限制(Standard 层):3,000 RPM / 4,000,000 TPM;Contributor 层:100 RPM / 3,000,000 TPM。Web 搜索接地为每 1,000 次查询 $2.50,Muse Image 为每张图 $0.01。定价页确认缓存以 cached_tokens 字段报告。

1.3 与 1.2 同价。

定价页将 1.3 与 1.2、1.1 并列在同一个 Standard 价格表下。升级到 1.3 在 API 层面不会改变单价——基准变化才是选择模型版本的理由,而非价格。

评测方法

Meta 为 1.3 发布了独立的评测方法论文档。要点:

基准官方方法要点
MRCR v2OpenAI 的 MRCR v2 数据,按 o200k_base token 计数重新分箱,在 256K–512K 与 512K–1M 两个区间各评测 100 个 8-needle 样本
DeepSWE v1.1长时程编程任务,以任务自带校验器判定,主指标为平均 pass@1
Terminal-Bench 2.189 个终端任务,使用结果标注的编程智能体在隔离云沙箱中运行,官方可执行校验器判定最终容器状态
SWE-Atlas代码库问答,按 Scale AI 排行榜协议执行,主指标为平均 pass@1

值得注意的两点:MRCR 用的是 OpenAI 的数据集(跨厂商可比性较好);智能体基准使用任务官方校验器而非模型自评。方法论文档同时说明 ZDR(零数据保留)与 Standard 同价,平台免费层额度适用。

如何在竞争中定位

把 1.3 放在今天的发布环境中读:Google 同日推出 Gemini 3.8 Flash(DeepSWE 73.7、Terminal-Bench 2.1 89.4、定价 $0.75/$3.75 促销价),而 1.3 的 DeepSWE 75.4、Terminal-Bench 88.8、$1.25/$4.25 同价延续。两家都以智能体编程为核心卖点,都在同一天发布。

现实的解读是:1.3 在长上下文检索上几乎没有对手(MRCR 98.5/98.1 对 GPT-5.6 Sol 的 91.5/73.8),DeepSWE 上小幅领先;OpenAI 与 Anthropic 仍在知识工作(GDPVal)与计算机使用(OSWorld)上保持优势。定价上 Meta 保持 1.2 时代的价格,而 Gemini 3.8 Flash 的促销价更低——但 3.8 Flash 的促销价 2027 年 1 月起上调至 $1.50/$7.50。

注意事项

所有性能数字为厂商自报。基准表来自 Meta 的发布材料,选用的对比配置(如 GPT-5.6 Sol max、Opus 5 max)由 Meta 选定。方法论文档降低了模糊性,但迁移前仍应在自己的工作负载上验证。

“约 20%/25%”是内部对比。工具调用与 token 的节省是与 1.2 的内部比较,没有公开任务清单。实际节省取决于工作负载。

开放权重无日期。“coming soon”没有附带时间表或许可条款。在正式发布前,API 是唯一的接入方式。

远程使用仍受限。与 1.2 时代相同,模型不支持在本地机器上运行——不存在本地模式。

结论

Muse Spark 1.3 值得认真对待,如果你在做长时程智能体工作、多仓库代码理解,或需要百万 token 上下文内近乎完美的检索。MRCR 98.5 + DeepSWE 75.4 的组合目前是独一档,而价格未变。

继续对比评测,如果你的核心场景是知识工作或计算机使用(GDPVal/OSWorld 上 Opus 5 仍领先),或成本敏感的高吞吐批处理(Gemini 3.8 Flash 的促销价与 Batch 生态更合适)。

常见问题

Muse Spark 1.3 是什么?

Meta 于 2026 年 9 月 2 日发布的旗舰推理模型,重点提升长时程智能体与编程任务,向 Muse Code 和 Meta API 开放,并有 "open weights releases coming soon" 的预告。

定价是多少?

Standard 层:缓存输入 $0.15、输入 $1.25、输出 $4.25(每百万 token);贡献者层(数据用于训练)$0.10/$0.20 且缓存 $0.002。muse-spark-1.3 与 1.2、1.1 共享同一 Standard 定价。

它带来了哪些智能体改进?

单线程内跨多个工作流执行长时程任务;更主动的协作(澄清问题、标记卡住状态、执行重要操作前确认);对自身能力边界有更好的校准;与 1.2 相比工具调用减少约 20%、token 减少约 25%。

MRCR 98.5 意味着什么?

在 256K–512K 与 512K–1M 两个 token 区间上,Muse Spark 1.3 的多轮共指消解准确率分别达到 98.5% 与 98.1%——作为对比,GPT-5.6 Sol 为 91.5 与 73.8。

权重会开放吗?

扎克伯格在发布帖中预告 "Muse Spark open weights releases coming soon",同时还有另一个以西瓜 emoji 暗示的发布。截至发稿,尚无日期与许可条款。

官方来源

仅官方来源,核对于 2026 年 9 月 2 日:

延伸阅读:Gemini 3.8 Flash 完整指南Gemini 智能体视频理解完整指南