Qwen 3.8 官宣:2.4 万亿参数开源权重,开源旗舰阵营扩军到 4 家

阿里刚在推特上官宣了 Qwen 3.8——2.4 万亿参数的开源权重模型,号称综合能力仅次于 Anthropic Fable 5。如果你在关注开源大模型的部署选项,这是一个值得放进雷达的信号。

2.4 万亿参数意味着什么

Qwen 3.8 用的是 MoE(混合专家)架构,2.4T 是总参数量,实际激活的活跃参数大概率在 200-400B 之间——和 Kimi K3、DeepSeek V4 属于同一个量级。这个体量的 MoE 模型,推理时主要吃的是活跃参数对应的显存,而不是总参数。

从部署角度看,200-400B 活跃参数的 MoE 模型,在 FP16 精度下大约需要 400-800GB 显存来存权重。如果用到 INT4/INT8 量化,这个数字能降到 100-200GB 左右——也就是 2-4 张 H100 或 4-8 张 A100 就能跑起来。对于有集群的团队来说,这不是一个离谱的硬件门槛。

(配图:Qwen 官方推特的截屏画面)

为什么这次发布值得注意

这是阿里在开源权重路线上又一大步。从 Qwen 2.5 到 Qwen 3 系列,阿里的模型一直以务实、部署友好著称——蒸馏版、量化版、不同尺寸的版本都跟得很齐。这次直接对标 Fable 5,说明阿里认为自己的模型已经够到了闭源旗舰的门槛。

对部署团队来说,多一个能跑的开源旗舰选择总是好事。DeepSeek V4、GLM-5.2、Kimi K3、Qwen 3.8——现在有 4 个中国开源的千亿到万亿级模型可选。竞争越激烈,推理定价的下行压力越大。

开源权重 vs API 定价

以 Qwen 3.8 这个体量的模型来看,自建推理的 token 成本大概在 $0.01-0.03/M token(按 GPU 折旧 + 电费算),而闭源 API(Claude、GPT-5.6)通常在 $0.10-0.90/M token。10-30 倍的成本差意味着,只要你的推理量够大,自建就是纯省钱。

当然,自建有运维成本。但当一个型号有 4 个开源竞品时,你可以在它们之间按场景路由——编码任务走这个、文档处理走那个、推理快的走简单的。多模型路由正在从口号变成可落地的部署策略。

内容来源
OfficeChai: Alibaba Announces 2.4 Trillion-Parameter Open-Weight Qwen 3.8
HN 讨论: news.ycombinator.com (star164)
Qwen 官方官推

4 个赞

这个体量的 MoE 用 4-8 张 A100 就能跑推理,确实把门槛降了不少。之前 2.4T 听起来吓人,实际活跃参数一算,比想象中可行。

2.4T 参数的 MoE,按 10-15% 活跃率算大概 240-360B 活跃参数。FP16 权重约 480-720GB,INT8 能压到 240-360GB。4 张 H100 NVL 或者 8 张 A100 80GB 应该够跑推理。如果阿里跟进 Qwen 3.5 的量化版路线,8 张 A100 跑量化版也不是没可能。

比较有意思的是阿里这次把 Qwen 3.8 定位成「仅次于 Fable 5」。从 Kimi K3 到 Qwen 3.8,中国开源模型都在对标闭源旗舰,但路数不太一样:Moonshot 偏模型能力本身,阿里更强调部署生态——Qwen 一直有完整的量化、蒸馏、vLLM 适配。

其实从部署角度看,2.4T MoE 最直接的影响不是模型多强,而是把开源旗舰的基数从 1-2 个推到了 4 个。选型空间大了之后,单模型绑定风险下降,你可以在不同供应商之间做推理路由。对于有流量波动的业务,这是一个被低估的结构性变化。

好奇 Qwen 3.8 会不会像 Qwen 2.5 那样出 0.5B/1.5B/3B/7B/14B 等全尺寸家族。之前 Qwen 2.5 系列从 0.5B 到 72B 都有,部署灵活性极高。如果 Qwen 3.8 也保持这个传统,从手机端到数据中心都能用同一族模型,那它的部署生态优势会很明显。

有个实际问题是 2.4T MoE 的冷启动时间。MoE 模型的 expert 路由表在推理前需要预热,第一次装入权重也要时间。对于需要快速扩缩容的场景,这个启动延迟是隐性成本。不知道阿里会不会提供类似 snapshot 或 pre-warm 的方案。

另一个维度:Qwen 3.8 的 license。如果延续 Qwen 2.5 的 Apache 2.0/Qwen License(商用需申请),那部署自由度会比 GLM-5.2 的 MIT 略低。不过对于大多数企业部署场景,商用申请基本都能过,差别不大。关键还是推理成本。