阿里把千问的下一站定在 5-10 万亿参数
阿里云云栖大会上,吴泳铭给出千问系列接下来的参数路线:Qwen 4.5 与 Qwen 5 目标 5-10 万亿参数,自研推理硬件真武 V900 预计 2027 年一季度量产。
云栖大会给出的参数路线
在阿里云年度云栖大会上,阿里巴巴 CEO 吴泳铭把千问(Qwen)系列接下来的参数目标摆了出来:现役旗舰 Qwen 3.8 Max 是 2.4 万亿参数;正在训练中的 Qwen 4 会继续往上走;再往后的 Qwen 4.5 与 Qwen 5 系列,目标区间落在 5 万亿到 10 万亿参数。
他把这套工作和「更复杂、周期更长的任务」绑在一起,并称目标是走向人工智能超级智能(artificial superintelligence)。同时提到的,还有团队在模型架构与数据优化上的持续研究。
推理侧的数字要一起看
只谈参数会漏掉一半。吴泳铭说,阿里自研的 M890 AI 超级节点已经能承担参数规模超过 2 万亿的模型的推理任务;下一代真武 V900 的性能据称为 M890 的三倍,预计 2027 年第一季度量产。
两组数字放在一条时间线上,意思就清楚了:Qwen 5 的 5-10 万亿目标,和 V900 的量产节点大体咬合。训练一个大模型,要的是集群规模和并行效率;把它推到线上、扛住真实流量,要的是另一套东西——显存带宽、互联带宽、单 token 成本。参数每上一个台阶,这些账都要重算一遍。阿里同时做模型和推理硬件,这条信息比参数本身更值得留意。
参数量不是能力证明
参数是最容易宣布、也最容易被质疑的指标。规模上去以后,训练成本、数据质量、评测饱和这几件事会一起放大。另一个麻烦是可比性:主流大模型普遍采用稀疏结构,「总参数量」和「每个 token 实际激活的参数量」已经越来越不是一回事。
倍数也可以直接说清楚。5 到 10 万亿,大约是现役旗舰的 2 到 4 倍,而中间只隔了几代。除非架构和效率优化把一部分成本吃掉,这个增速对训练预算并不友好。
也就是说,5-10 万亿究竟是一次实打实的跃升,还是一个会被反复引用的数字,取决于架构。这次表态没有给出架构细节、发布时间、训练数据规模,也没有说明 5-10 万亿指的是总参数还是激活参数。没有评测成绩,没有基准对比。留下这些空白,恰恰是判断这份路线图成色时最该盯的地方。
接下来能验证什么
可核对的东西不多,但都挺硬。Qwen 4 相对 Qwen 3.8 Max 在公开评测上有没有可测的提升。真武 V900 能不能按计划在 2027 年一季度量产——阿里手里已有上一代推理硬件,这更像执行问题,而不是概念问题。以及开源权重版本的节奏会不会跟上旗舰线,因为 Qwen 的开发者生态依赖的是能下载的模型文件,而不是发布会上的路线图。
阿里把参数上限抬了一档,也给推理芯片定了个日期。剩下的等结果。
来源:阿里巴巴下一代模型参数将扩大到 5-10 万亿规模(Solidot)