AI 前沿 · 动态速递
Beam 的体量和 Mistral Large 4 差了一个量级,但思路一致:总参数撑能力,激活参数控成本。5010 亿总参数里,每个 token 只激活 230 亿。Reflection 的核心主张不是「我最大」,而是「我同等聪明但更便宜」——它说 Beam 在高级推理基准上能打平 Z.ai 的 GLM-5.2,推理算力只要后者的三分之一到四分之一;对超过两万亿参数的模型(比如 Qwen 3.8-Max)优势更大。公司自己也承认,在绝对能力上 Kimi K3 仍然领先——这句话挺坦诚,也说明开源阵营现在的竞争焦点确实是效率。
训练细节比数字更有信息量。预训练用了 23.8 万亿 token,端到端不到四周完成,集群规模是 6144 张英伟达 GB300 NVL72(强化学习阶段的报道口径为 10500 张);强化学习阶段生成了超过 1 亿次 rollout,平均维持 11 万个并发 rollout,峰值支持 17 万个并发沙箱,全过程处理了超过 10 亿次沙箱创建请求,横跨 20 多个集群、两朵云、四个区域。训练期间权重对外下发的中位时间是约 12 秒;遇到 71 次推理故障都没有中断训练;九次半自动回滚,原因是梯度范数尖峰或疑似静默数据损坏。数据侧的说法也很具体:原始互联网 token 有约 95% 被淘汰,但他们认为常规过滤手段会漏掉约 1.8 万亿高质量 token,其中包括 87% 的精选网页代码数据。
官方给出的分数是:Terminal Bench v2.1 80.1、SWEBench Verified 80.9、SWE Bench Pro v2-Hard 77.2、AIME 2026 97.8、Humanity's Last Exam(无工具)36.2、GPQA Diamond 90.5。这些都是自报数据,且未附完整基准表,第三方独立复测还没出来,所以现在只能当方向参考。两个小细节倒是挺说明问题:第一,它提供了一个可调的「推理力度」参数,你可以用更少的 token 换更短的答案;第二,在强化学习过程中,虽然没训练浏览任务,浏览能力自己涨了——有网的时候它还学会了自己去问别的模型、调 OCR 接口读文档。权重、技术报告和模型卡计划本月晚些时候以 Apache 2.0 放出,目前只对少量受邀用户开放早期版本。
这两天的开源新闻值得放在一起看:欧洲的 1 万亿、美国的 5010 亿,比的都不是「谁参数多」,而是「同样的活,谁花的电少」。为什么这件事重要?因为对绝大多数企业来说,决定能不能用 AI 的从来不是能力上限,而是每次调用要花多少钱。开源模型把这条线往下压,最终受益的是所有用工具的人——包括我们自己。
本文整理自公开新闻与技术资料,数据为报道时点数字,仅供知识科普,不构成任何投资或采购建议;产品能力与价格请以厂商官方发布为准。