Reflection 发布 Beam 预览:5010 亿总参数,为何只激活 230 亿?
一套模型有 5010 亿参数,却说每次处理一个词元只激活 230 亿。两个数字放在一起,很容易让人误以为它实际上只是一款小模型,或以为部署费用也会按同样比例缩小。
Reflection 在 2026 年 10 月 5 日公布的 Beam 预览,正好适合把这个问题讲清楚。公司将它定位为首款开放权重模型,采用稀疏混合专家架构,面向编程、推理与智能体任务。当前开放的是面向部分用户的早期访问,权重与技术报告仍属于本月后续发布计划。
根据 Semafor 的报道,Reflection 由两名前 DeepMind 研究者创办于 2024 年,联合创始人为 Misha Laskin 和 Ioannis Antonoglou。对这家新进入大众视野的公司,Beam 是一次具体的产品交付,也是一张必须接受外部检验的技术名片。
“只激活一部分”,省的是哪一部分?
可以把模型想成一间藏有很多书架的图书馆。一次查询只需要查其中一部分,查询工作可以变少,但其余书架不会因此自动消失。
MoE,也就是混合专家模型,有类似的思路。这里的“专家”是神经网络子模块。路由机制会按词元选择部分子模块参与计算;下一步处理别的词元,选择也可能变化。词元是模型处理文字的基本单位,不能直接等同一个汉字或一整次回答。
Mixtral 的原始论文详细解释过这种机制,也明确区分了激活参数对应的计算量,与整套权重带来的存储和内存要求。用它理解 MoE 的基本概念,不代表 Beam 采用了 Mixtral 相同的专家数量或具体配置。

原创参数示意,依据 Reflection 10 月 5 日公开数值绘制,2026 年 10 月 8 日核查。约 4.6% 是参数数量比值,不是实测显存、速度或价格比例。
总参数更多,说明整套模型规模更大;单个词元激活较少,则可能降低部分计算需求。完整部署还需要安排权重存储、专家读取和通信、上下文缓存以及硬件利用率。Mixtral 作者也指出,路由和额外内存读取会带来开销。因此,不能只拿“230 亿激活”去估算需要哪张显卡,更不能直接宣布它与同规模稠密模型有相同的运行速度。
这条技术路线也在不断继承已有研究。Beam 公告援引了 DeepSeek-V3 技术报告中的负载均衡方法:在分配计算时,需要避免一部分专家过忙、另一部分闲置。这份报告首次提交于 2024 年底,是理解技术背景的资料,不是 DeepSeek 今天又发布了新模型的消息。
省三到四倍计算,不等于账单降到四分之一
Reflection 声称,在相关推理基准上,Beam 能以更少的推理计算取得接近 GLM-5.2 的结果。真正值得一起读的,是这句话后面的计算方法。
原公告的效率比较,根据激活参数与生成词元数量估算部分计算量;它明确排除了输入预填充、随上下文变化的注意力运算和服务开销。这是近似计算比较,不能当作已经测出的推理价格或整段任务成本。
为什么这会影响实际使用?设想两个任务:一个只需读几行代码,另一个要读大量文件、运行测试、检查结果并反复修改。即使两者最后都输出一份很短的补丁,读入上下文和工具往返的工作量也不同。后一类工作里,输出文字的计算量,只是成本的一部分。
所以,我更关心开放后的完整任务数据:模型是否一次完成、需要多少次重试、读入多少材料、硬件是否充分利用,以及最终用了多少时间和资源。参数更省与推理更短,都可能有价值;是否转化为实际节省,要放到相同任务和相同部署条件下检验。
两个编程分数,不能直接拿来比高低
Beam 的发布表给出了多个编程评测结果。其中两个容易被简称成同一个“SWE 成绩”:
| 完整评测名称 | Reflection 公布的 Beam 分数 |
|---|---|
| SWE-bench Verified | 80.9% |
| SWE-bench Pro v1 | 65.5% |
这些是发布方数据,本文没有独立复现。它们来自不同评测,不能把百分数大小直接读成同一项能力的涨跌。原表中的“未报告”也不能当成竞争模型得了零分。
SWE-bench 官方网站区分了 Verified、Multilingual 等不同题集,也提供在统一智能体环境下进行比较的视图。对真实开发者,评测版本、工具环境和运行方式都影响结果;同样叫“编程”,修复现有仓库问题和从零交付一个应用,也不是同一种考验。
Beam 的结果可以帮助判断它目前处在什么位置,却不足以支撑“全面领先所有模型”这样的标题。等技术报告与可运行材料公开,外部团队在统一条件下复核,比较才会更有用。
这家新公司的机会,在日常工作里
Reflection 早在 2025 年 8 月的战略公告中,就把开放模型、训练基础设施和可扩展的商业路线放在一起。Beam 的首发延续了这个方向:让企业有机会控制、调整和部署模型,而不只是购买一个固定的在线入口。
Axios 的相关观察也将用户控制权视为竞争焦点。本站此前报道的 Mistral Large 4则提供了另一家开放模型公司的近期进展,可以对照阅读。
我的判断是,Beam 最值得跟踪的竞争问题,是它能否稳定承担大量日常编程与智能体工作,并把效率优势交付给真正部署它的人。对企业,一套可以调整的模型,仍需要可靠的工具链、评估和运维;开放的价值要靠这些能力变得具体。
截至本文核查,Reflection 计划在 10 月以 Apache 2.0 许可发布权重和配套材料。读者可以把这当作下一次需要验证的交付节点,暂时还不能当作已经完成的开放。公布参数只是开始,后续可下载、可运行、可复核的结果,才会回答 Beam 这张技术名片有多大分量。
本文于北京时间 2026 年 10 月 8 日核查,新闻事件日期为 10 月 5 日。主公告之外,实际查阅了以下六篇补充资料:
评论