阿里刚在推特上官宣了 Qwen 3.8——2.4 万亿参数的开源权重模型,号称综合能力仅次于 Anthropic Fable 5。如果你在关注开源大模型的部署选项,这是一个值得放进雷达的信号。
2.4 万亿参数意味着什么
Qwen 3.8 用的是 MoE(混合专家)架构,2.4T 是总参数量,实际激活的活跃参数大概率在 200-400B 之间——和 Kimi K3、DeepSeek V4 属于同一个量级。这个体量的 MoE 模型,推理时主要吃的是活跃参数对应的显存,而不是总参数。
从部署角度看,200-400B 活跃参数的 MoE 模型,在 FP16 精度下大约需要 400-800GB 显存来存权重。如果用到 INT4/INT8 量化,这个数字能降到 100-200GB 左右——也就是 2-4 张 H100 或 4-8 张 A100 就能跑起来。对于有集群的团队来说,这不是一个离谱的硬件门槛。
(配图:Qwen 官方推特的截屏画面)
为什么这次发布值得注意
这是阿里在开源权重路线上又一大步。从 Qwen 2.5 到 Qwen 3 系列,阿里的模型一直以务实、部署友好著称——蒸馏版、量化版、不同尺寸的版本都跟得很齐。这次直接对标 Fable 5,说明阿里认为自己的模型已经够到了闭源旗舰的门槛。
对部署团队来说,多一个能跑的开源旗舰选择总是好事。DeepSeek V4、GLM-5.2、Kimi K3、Qwen 3.8——现在有 4 个中国开源的千亿到万亿级模型可选。竞争越激烈,推理定价的下行压力越大。
开源权重 vs API 定价
以 Qwen 3.8 这个体量的模型来看,自建推理的 token 成本大概在 $0.01-0.03/M token(按 GPU 折旧 + 电费算),而闭源 API(Claude、GPT-5.6)通常在 $0.10-0.90/M token。10-30 倍的成本差意味着,只要你的推理量够大,自建就是纯省钱。
当然,自建有运维成本。但当一个型号有 4 个开源竞品时,你可以在它们之间按场景路由——编码任务走这个、文档处理走那个、推理快的走简单的。多模型路由正在从口号变成可落地的部署策略。
内容来源
OfficeChai: Alibaba Announces 2.4 Trillion-Parameter Open-Weight Qwen 3.8
HN 讨论: news.ycombinator.com (star164)
Qwen 官方官推