昨天晚上刷 HN 的时候看到一条消息——Meta Superintelligence Labs 发了 Muse Spark 1.1,还同步上线了自家的 Meta Model API,第一次面向开发者收费。我当时第一反应是:Meta?搞 AI 编程?认真的吗?
毕竟提起 AI 编程,脑子里蹦出来的名字一直是 Claude、GPT、Copilot 这些。Meta 在这个赛道上的存在感,说实话,基本为零。Llama 系列虽然开源社区用得多,但编程能力一直不是强项。
但仔细看完发布博客、benchmark 数据和 CNBC 的报道之后,我的态度变了——这次 Meta 可能真的要搅局了,而且搅局的方式很简单粗暴:把价格打到地板上。
Muse Spark 1.1 到底是个什么东西
先说结论:这是一个多模态推理模型,专门为 agent 任务设计的。你可以把它理解成 Meta 版的 Claude——能写代码,能操控电脑,能处理图片和视频,还有 100 万 token 的上下文窗口。
Muse Spark 1.1 是今年 4 月份发布的初代 Muse Spark 的升级版。初代当时只给少数合作方通过私有 API 预览,基本没多少人真正用过。这次 1.1 版本算是正式面向公众了,而且开放了 Meta Model API 让所有开发者都能接入。
核心能力拆开来看:
编程能力:Meta 的说法是 Muse Spark 1.1 在大型复杂代码库上的表现"显著提升"。能诊断和修复复杂 bug,能在企业级系统里实现新功能,能搞大规模代码迁移。他们还在内部测试中跟主流竞品做了对比,声称在 Meta Internal Coding Bench 上跟 Claude、GPT 这些"领先模型"有来有回。
多 agent 编排:这个是我觉得最有意思的点。Muse Spark 1.1 被训练成可以同时扮演主 agent 和子 agent 两个角色。作为主 agent,它会收集上下文、制定计划,然后把任务分发给并行的子 agent 去执行。作为子 agent,它专注于自己那部分,知道什么时候该把结果上报给主 agent。还支持零样本泛化到新的原生工具、MCP 服务器和自定义技能——不需要专门训练就能用新工具。
电脑操控:这点跟 Claude 的 computer use 很像。Muse Spark 1.1 可以操控桌面应用,跨多个软件完成工作流。但它有个不太一样的地方——不是一步一步点击,而是会自己判断什么时候写脚本更快、什么时候直接点击更简单,还能批量生成操作步骤。
上下文管理:100 万 token 的上下文窗口不算稀奇了(GPT 和 Claude 也有),但 Muse Spark 1.1 能"主动管理"这个窗口。什么意思呢?就是它自己会记住之前的操作,从更早的工作中检索信息,还会压缩上下文——但压缩的时候会保留对后续工作关键的信息。
benchmark 数据:该认的认,该夸的夸
Meta 在发布博客里放了一堆 benchmark 图表。我把关键数据捞出来了:
MCP Atlas(MCP 工具使用能力测试):Muse Spark 1.1 拿了 88.1 分,排第一。Claude Opus 4.8、GPT-5.5 和 Gemini 3.1 Pro 都在它后面。这个成绩说实话挺猛的,说明 Meta 在 agent 工具调用这块下了很大功夫。
Humanity's Last Exam(号称最难的综合推理测试):Muse Spark 1.1 62.1 分,也是第一。这个测试连很多顶级模型都考不好,62 分确实能说明推理能力。
SWE-Bench Pro(真实软件工程任务):这块就一般了,61.5 分,Claude Opus 4.8 以 69.2 分领跑。不过 Meta 自己也说了,这个 benchmark 本身有争议(OpenAI 说它的设计不公平),所以排名仅供参考。
VALS-AI 独立测试:这个是第三方做的,Muse Spark 1.1 总排第四。但有个亮点——速度和性价比指标特别突出。在 Vibe Code Bench 这个编程专项测试里,比初代跳了 36 个名次。
整体来看,Muse Spark 1.1 在 Meta 公布的 12 个 benchmark 中赢了 4 个(MCP Atlas、JobBench、Humanity's Last Exam、Finance Agent v2),Opus 4.8 赢了 5 个,GPT-5.5 赢了 3 个。
说白了,它不是最强的那个,但差距没你想的那么大。考虑到价格因素,这个画面就不一样了。
有个细节得提一下:benchmark 数据是 Meta 自己测的,难免有"主场优势"。选哪些 benchmark、怎么设测试条件、甚至系统提示词怎么写,都会影响结果。所以我对 Muse Spark 1.1 在 MCP Atlas 和 Humanity's Last Exam 上的高分持谨慎乐观态度。不过 VALS-AI 是第三方独立测试,它排第四这个排名可能更接近真实水平。好消息是 VALS-AI 也说了 Muse Spark 1.1 在速度和性价比方面特别突出——这倒是跟定价策略吻合的。
价格:这才是真正的杀手锏
看到价格的时候我愣了一下,反复确认了三遍。
- 输入:$1.25 / 百万 token
- 输出:$4.25 / 百万 token
- 缓存输入:$0.15 / 百万 token
- 网页搜索:$2.50 / 1000 次查询
- 新用户:$20 免费额度
对比一下同行:
- Anthropic Opus 4.8:$25-50 / 百万输出 token
- OpenAI GPT-5.5:$25-50 / 百万输出 token(看具体模型档位)
- Fable 5:类似价位
- xAI Grok 4.5:之前是最便宜的近前沿模型,现在被 Meta 甩在后面了
- 中国模型 GLM 5.2:也很便宜,但 Meta 在美国主流厂商里创了个价格新低
输出 token 价格 $4.25 vs $25-50,差距是 6 到 12 倍。
这个价格策略不是"比竞品便宜一点",是直接把桌子掀了。Meta 有每年 600 亿美元以上的利润,完全可以不靠 API 赚钱,先用低价把开发者圈过来。这跟当年 AWS 用低价抢占云市场是一个思路。
CNBC 报道里引了 AI 负责人 Alexandr Wang 的原话:"跟 Anthropic 和 OpenAI 的同类产品相比,我们的定价非常有竞争力和吸引力。"——这话说得很外交了,实际意思就是"我就是要用价格碾压你们"。
Wang 还提到他自己在"dog-fooding"(内部试用)这个模型,特别提到拿它来搜论文、读学术文献、管理个人健康数据。这些用例跟编程没直接关系,但说明了 Meta 对 agent 能力的定位——不只是写代码,而是帮你处理各种复杂的信息任务。
不开源:社区最大的争议点
说到这里得提一个让开源社区不太爽的事:Muse Spark 1.1 不开源。
没有 open weights,拿不到模型权重,不能自己部署。对于习惯了 Llama 系列开源福利的开发者来说,这是一个挺大的态度转变。Meta 之前靠开源 Llama 在 AI 社区积累了大量好感,现在搞闭源收费,自然有人不买账。
不过 Alexandr Wang 在 CNBC 的采访里留了个口子——他说 MSL 有一个 Muse Spark 的开源变体"正在开发中",但没说什么时候发布。之前 Muse Spark 的内部代号叫 Avocado,下一代旗舰模型代号叫 Watermelon,目前正在训练中。
我的判断是:Meta 之前的开源策略是为了建立生态和影响力。现在他们觉得自己在 AI 编程市场有了真正的竞争力,就开始走商业化路线了。这种策略转变很正常——Google 的 Gemini 也不是完全开源的。但对你我这样的开发者来说,能用 API 就行,开源不开源对实际使用影响不大,除非你有本地部署的刚需。
实际怎么接入
Meta Model API 目前在 public preview 阶段。接入方式是标准的 REST API,而且号称跟 OpenAI API 兼容。
首先得去 dev.meta.ai 注册开发者账号,拿到 API key。新账号有 $20 免费额度,够你测试一阵子的。
API 调用格式跟 OpenAI 类似。如果你已经用惯了 OpenAI 的 SDK 或者 LangChain 之类的框架,迁移成本很低:
| 1 | |
| 2 | |
| 3 | |
| 4 | |
| 5 | |
| 6 | |
| 7 | |
| 8 | |
| 9 | |
| 10 | |
| 11 | |
| 12 | |
| 13 | |
| 14 | |
| 15 | |
| 16 | |
注意上面的代码是基于 OpenAI SDK 的兼容模式。Meta 声称支持 OpenAI 兼容接口,所以你现有的 OpenAI 客户端代码理论上只需要改一下 base_url 和 api_key 就能跑。实际兼容到什么程度还需要社区验证——有时候"兼容"只是基本请求格式一样,流式输出、function calling、structured output 这些高级功能可能有差异。建议先从简单的 chat completion 开始测。
如果你想用 cURL 直接调:
| 1 | |
| 2 | |
| 3 | |
| 4 | |
| 5 | |
| 6 | |
| 7 | |
| 8 | |
目前确认支持的接入方式:
- Meta Model API(官方,公测中)
- OpenAI 兼容接口(可以直接切过来)
- Meta AI app / meta.ai 网页版(Thinking 模式)
- 第三方工具:Replit、Cline、OpenCode、OpenClaw 已经有早期接入
Cline 的 CEO Saoud Rizwan 的话挺有代表性的:"Meta 明显是在认真做 agentic coding——强大的工具调用能力,加上一个让大规模 coding 工作流在经济上可行的价格。这种组合很少见。"
跟 Claude / GPT 到底怎么选
这是大家最关心的问题。我根据目前的数据做个横向对比(注意:Muse Spark 1.1 刚发布,实际体验可能跟 benchmark 有出入)。
编程能力:Claude Opus 4.8 目前仍然是天花板,SWE-Bench Pro 上 69.2 分领先。Muse Spark 1.1 在 61.5 分,差距不算太大但确实存在。如果是写复杂的企业级代码、做大重构,Claude 可能还是更靠谱的选择。如果是日常编程、写脚本、做原型,Muse Spark 1.1 完全够用,而且成本低得多。
Agent 能力:这块 Muse Spark 1.1 反而领先了。MCP Atlas 88.1 分排第一,说明在工具调用、MCP 集成这些 agent 核心能力上,Meta 做得很扎实。如果你的项目重度依赖 agent 工作流(自动化操作、多工具编排),Muse Spark 1.1 值得优先考虑。
多模态:Muse Spark 1.1 支持图片、视频、PDF 输入,还有超详细的内容描述能力。Meta 演示了一个场景:用户拿手机拍一段视频,Muse Spark 1.1 自动从中提取有用的截图,分析产品,然后操控浏览器在 Facebook Marketplace 上创建商品列表。这种"感知+行动"的组合确实实用。
速度:从 VALS-AI 的测试来看,Muse Spark 1.1 的推理速度相当快。而且它支持多 agent 并行执行,对复杂任务的端到端延迟有优化。
成本:这是 Muse Spark 1.1 最大的优势。同样跑一个编程 agent 任务,用 Claude Opus 可能花 $5,用 Muse Spark 1.1 可能只要 $0.5。如果你是高频使用者或者跑大量并行 agent,这个差距就很要命了。
中文支持:这块目前没有明确的 benchmark 数据。Meta 的模型中文能力历史上一般不如 GPT 和 Claude。如果你的工作主要是中文场景,建议先用 $20 免费额度测试一下再决定。
算一笔真实的账
假设你是一个独立开发者,每天用 AI 编程工具写代码。以下是一个粗略的月成本估算:
场景一:轻度使用
每天大约 10 万 token 输入 + 2 万 token 输出(大约每天让 AI 写几个函数,做几次 code review)。
- Claude Opus 4.8:输入 $0.25/天 + 输出 $0.5/天 = $0.75/天 → $22.5/月
- Muse Spark 1.1:输入 $0.125/天 + 输出 $0.085/天 = $0.21/天 → $6.3/月
差距约 3.6 倍。
场景二:重度 agent 工作流
每天 100 万 token 输入 + 20 万 token 输出(跑大量自动化 agent,处理大型代码库)。
- Claude Opus 4.8:输入 $2.5/天 + 输出 $5/天 = $7.5/天 → $225/月
- Muse Spark 1.1:输入 $1.25/天 + 输出 $0.85/天 = $2.1/天 → $63/月
差距约 3.6 倍,绝对差距 $162/月。
场景三:开启缓存
如果你大量复用相同的上下文(比如反复让 agent 读同一个大文件),缓存价格就发挥作用了。
缓存输入 $0.15/M token,是正常输入价格的 12%。假设 50% 的输入命中缓存:
- Claude Opus 4.8:$2.5 × 0.5 + $2.5 × 0.1 × 0.5 + $5 = $1.25 + $0.125 + $5 = $6.375/天 → $191/月
- Muse Spark 1.1:$1.25 × 0.5 + $1.25 × 0.12 × 0.5 + $0.85 = $0.625 + $0.075 + $0.85 = $1.55/天 → $46.5/月
差距进一步拉大。
结论很简单:如果你在 AI 编程工具上每月花超过 $50,Muse Spark 1.1 值得认真评估。特别是对那些跑大量 agent 工作流的团队,省下来的钱可能就是多招一个人的工资。
社区怎么看的
看了一圈 HN、Reddit 和各种报道,社区的反应挺分化的。
看好的一派主要关注性价比。Replit CEO Amjad Masad 的评价很高:"Muse Spark 最让人印象深刻的是它一个模型塞了多少东西进去——百万级上下文、完整的多模态支持、内置搜索和引用、强推理、顶级编程能力、结构化输出、并行工具调用——全在一个干净的 OpenAI 兼容包里。一个完整的 agent 基础。"这话有公关成分,但也说明了 Meta 在"全家桶"策略上做得不错。
观望的一派主要担心几个问题:
一是 benchmark 和实际体验的差距。Meta 自家公布的 benchmark 当然会挑好看的展示,VALS-AI 这个第三方测试排在第四,说明综合能力还不是最强。模型在实际项目中的表现往往跟 benchmark 有出入。
二是不开源的争议。很多开发者觉得 Meta 背叛了开源社区。之前 Llama 系列培养出来的生态和信任感,一夜之间变了味。有人担心 Meta 会不会走"先低价圈地、后涨价收割"的老路。
三是 Meta 的隐私和数据使用政策。你在 Meta 的 API 上跑代码,代码会不会被拿去训练?这跟用 OpenAI 或 Anthropic 的顾虑类似,但 Meta 作为广告公司的身份让这个担忧更明显一些。
我的看法:benchmark 数据可以参考但不能全信,尤其是一个刚发布两天的模型。最靠谱的方式是自己拿 $20 免费额度跑几个真实项目试试。如果编程能力确实能打,再加上这个价格,那确实是 Claude 和 GPT 之外一个很好的补充——不一定是替代,但至少可以在对成本敏感的场景切过去。
价格战:开发者该关心什么
Muse Spark 1.1 的定价不只是 Meta 一个公司的事。你得把它放到整个 AI 价格战的大背景里看。
现在的情况是这样的:AI 模型市场正在被两头挤压。
一头是 Google 和 Meta 这种有庞大主业利润支撑的大厂。Google 有搜索广告,Meta 有社交广告,每年各自赚几百亿上千亿。API 收入对它们来说可能是零头,亏着钱也无所谓。它们可以用低价甚至免费把开发者圈进自家生态。
另一头是 中国的开源模型。GLM 5.2、DeepSeek 这些模型,成本低到离谱。Snowflake 的 CEO 公开说过,GLM 5.2 在编程任务上的表现跟 Opus 4.7 差不多,但成本只有一小部分。Coinbase 和 Lindy 这些公司已经把整个 AI 后端从 Claude 切到了中国模型,省了几百万美元。
夹在中间的是 OpenAI 和 Anthropic。这两家是纯 AI 公司,每年烧掉几十亿美元,完全靠 token 差价养活自己。它们的模型可能确实是最好的,但定价空间正在被压缩。Anthropic 的 Opus 4.8 卖 $25-50/M 输出 token,Meta 卖 $4.25,差了 6 到 12 倍。即使 Opus 稍微强一点,很多场景下这个价差根本无法 justify。
对开发者来说,这意味着:
- 能力差距在缩小,价格差距在拉大。上一代模型的时代,Claude 和 GPT 的编程能力可能甩开第二名 20% 以上,贵一点也值。但 2026 年各家模型的能力差距已经小了很多——benchmark 上差几个百分点的差距,在实际项目里经常感受不到。
- 混合路由成为主流策略。不需要死守一个模型。简单的代码补全用便宜的模型(Muse Spark 1.1、GLM 5.2),复杂的架构设计和深度调试用最强的(Claude Opus)。很多 agent 框架已经支持模型路由——根据任务复杂度自动选择模型。
- 锁定风险要考虑。用了 Meta 的 API,你的数据、工作流都绑在 Meta 上了。虽然 API 兼容 OpenAI 格式,切换成本不高,但如果你重度依赖了 Muse Spark 1.1 的某些独特能力(比如多 agent 编排),以后要切走就会麻烦。保持模型可替换的架构设计很重要。
Meta 的 agent 战略:不只是模型
仔细看 Muse Spark 1.1 的设计理念,你会发现 Meta 的野心不只是卖 API。
Alexandr Wang 在 CNBC 采访里说了一句话很关键:"你必须把编程能力作为整体 agent 能力的一部分来构建。"翻译成人话就是——Meta 不是在做一个"会写代码的聊天机器人",而是在做一个"能干活的 AI agent",写代码只是它的技能之一。
这个定位决定了 Muse Spark 1.1 跟 GPT 和 Claude 的差异化路线:
Claude 走的是"最强编程助手"路线——在终端里写代码、做 code review、debug。它像一个超级聪明的同事坐在你旁边。
GPT 走的是"最强通用模型"路线——什么都能干,编程只是其中之一。它像一个百科全书式的助理。
Muse Spark 1.1 走的是"最强 agent"路线——重点是让它自己去干活,不是你问它答。它需要有规划能力、执行能力、跟外部工具交互的能力。写代码是手段,不是目的。
Meta 选择这个方向其实有必然性。Meta 没有 OpenAI 那样的 ChatGPT 用户基数,也没有 Anthropic 在企业市场的深耕。但它有自己的生态——Facebook、Instagram、WhatsApp、Messenger。如果把 Muse Spark 1.1 做成一个强大的 agent 引擎,它可以在 Meta 的社交生态里做很多事:帮你管理 Marketplace 上的商品、帮你在 Instagram 上分析内容数据、帮你处理 WhatsApp 上的客户咨询。这些场景是 OpenAI 和 Anthropic 进不去的。
Facebook Marketplace 的 demo 就很说明问题。你拍一段手机视频,Muse Spark 1.1 自动提取商品照片、生成描述、操控浏览器帮你发 listing。这不是"AI 帮你写代码",这是"AI 帮你干活"。Meta 的赌注就是:agent 的未来不只在编程,而在日常生活的方方面面。
当然,能不能赌对就是另一回事了。目前这些 demo 都是受控环境下的展示,真实场景的表现要打了折扣。但方向是对的——agent 确实是 AI 的下一个战场。
几个你可能想问的问题
Muse Spark 1.1 能本地部署吗?
不能。跟 Llama 不同,Muse Spark 1.1 是闭源模型,没有公开权重。只能通过 Meta Model API 或者 Meta AI app 使用。Alexandr Wang 说有开源变体在开发中,但没给时间表。
跟 Llama 4 是什么关系?
完全不同的产品线。Llama 是开源系列,定位是通用语言模型。Muse Spark 是 Meta Superintelligence Labs 的旗舰闭源模型,定位是 agent + 编程 + 多模态。Meta 现在的策略好像是两条腿走路——Llama 守开源生态,Muse Spark 攻商业市场。
可以用来替代 Claude Code 吗?
理论上行,Muse Spark 1.1 支持主流的 agentic coding 框架,包括 OpenCode、Cline、OpenClaw。如果你的工作流是这些工具驱动的,把模型从 Claude 切到 Muse Spark 1.1 可能就是改个配置的事。但编程能力的实际差距得你自己测。Meta 在博客里演示了在 OpenCode 里用 Muse Spark 1.1 做 debug——自己建了个聊天 web app,截图检查 UI 问题,定位代码修复,然后验证。整个流程看起来挺丝滑的。
$20 免费额度能测多久?
按输出 $4.25/M token 算,$20 大约能跑 470 万 token 的输出。如果你做的是中等强度的编程测试(每次请求几百到几千 token 输出),大概能测几百次请求,够你摸清楚它的编程能力了。但如果你的测试涉及大量上下文(比如喂一个完整的代码库进去),输入 token 也要算。100 万 token 的上下文窗口意味着一次请求就能吃掉 $1.25 的输入费用。所以测大型代码库的时候要悠着点,$20 可能几次请求就没了。
中文支持怎么样?
目前没有看到针对中文的专项 benchmark。Meta 的模型在中文场景历史上不如 GPT 和 Claude。但 Muse Spark 1.1 是多模态模型,训练数据量应该不小。建议先用中文问几个问题试试,再决定要不要在中文项目中用。
跟 GLM 5.2 比哪个划算?
两个都是"价格屠夫",但路线不同。GLM 5.2 是开源的,你可以自己部署,成本只看你的硬件。Muse Spark 1.1 是闭源的,只能用 API。如果你有 GPU 服务器,GLM 5.2 长期成本更低;如果你只想用 API 不想折腾基础设施,Muse Spark 1.1 更省心。从能力上说,GLM 5.2 在编程 benchmark 上表现很猛(之前我们网站也分析过),Muse Spark 1.1 的优势在于多模态和 agent 编排。两者各有所长。
新手上手建议
如果你打算试试 Muse Spark 1.1,我建议按这个顺序来:
第一步,注册 Meta Model API 开发者账号,拿到 API key 和 $20 免费额度。
第二步,先用简单的对话测一下它的"脑子"好不好使。问几个你有明确答案的问题——比如算法题、代码 bug、技术概念解释。跟 Claude 或 GPT 的回答对比一下。
第三步,测编程能力。找个你熟悉的中小型项目,让 Muse Spark 1.1 做几个常见任务:加个新功能、修个 bug、重构一段代码。看它生成的代码质量、对项目结构的理解、以及对上下文的把握。
第四步,如果你用 Cline 或 OpenCode 之类的 agent 框架,尝试把 Muse Spark 1.1 接进去。改一下配置里的模型和 API 地址,跑一遍你日常的 agent 工作流。重点关注:工具调用的准确率、多步骤任务的规划能力、以及 token 消耗量。
第五步,算成本。记录一周的使用数据——每天消耗多少 token,花了多少钱。跟之前用 Claude 或 GPT 的账单对比。如果成本降低 60% 以上且能力差距可以接受,那就考虑做部分切换。
别一上来就把所有任务都切过去。最稳的做法是混合路由:简单任务给 Muse Spark 1.1,复杂任务给 Claude。等你对 Muse Spark 1.1 的能力边界摸清楚了,再逐步增加它的占比。
写在最后
Muse Spark 1.1 这步棋,我觉得 Meta 走得挺聪明的。在模型能力还不是绝对领先的情况下,用价格优势切入市场,先把开发者圈过来,再靠迭代追上去。这种打法在科技行业屡试不爽——AWS 对云、Android 对手机、TikTok 对短视频,都是类似的逻辑。
对开发者来说,这是好事。多一个有竞争力的选择,意味着其他厂商也得跟着降价或者提升能力。AI 模型的价格战已经开打了,GLM 5.2 从中国这边压价,Muse Spark 1.1 从美国这边压价,Claude 和 GPT 夹在中间。最终受益的是我们这些用 API 的开发者。
对了,Alexandr Wang 透露 Meta 正在训练下一代旗舰模型,代号 Watermelon。Muse Spark 1.1 的代号是 Avocado,初代 Muse Spark 在今年 4 月发布,到现在才三个月就出了 1.1。如果 Watermelon 保持这个节奏,年底前可能就会有下一代出来。到时候价格可能更低、能力更强——AI 模型的迭代速度快到让人头昏。
我打算这周末拿 $20 免费额度跑几个真实项目试试。重点测三个东西:一是编程能力到底比 Claude 差多少(差距在 10% 以内就可以考虑切换),二是多 agent 编排的实际体验(demo 很好看,真跑起来才知道好不好使),三是中文场景的表现(如果中文能力太差就只能当英文工具用了)。测完了再写一篇实测报告。
在这个 AI 模型百花齐放的时代,多一个选择永远不是坏事。关键是别被"最便宜"或"最强"这种单一标签忽悠,找到适合自己场景的那个才是正事。
有啥问题评论区聊。