行业资讯

  • 首页
  • 行业资讯
  • 阿里发布 Qwen3.8‑Flash:125B MoE,单 token 激活6B

阿里发布 Qwen3.8‑Flash:125B MoE,单 token 激活6B

2026-08-26

阿里通义千问团队推出了 Qwen3.8‑Flash,一款基于下一代 Qwen4 架构的多模态 MoE(混合专家)模型。该模型主体参数为125B(约1250亿),外加51B的 N-gram Embedding,总体设计使得每个 token 仅需激活约6B 参数。官方把它作为 Qwen4 架构的技术预览,便于开发者提前适配新特性。

在架构上,Qwen3.8‑Flash 在四个方面做了系统性升级: - Attention:采用 GDN(Gated DeltaNet)与 QSA(Qwen Sparse Attention)混合方案。GDN 用于高效压缩历史信息,QSA 通过轻量级 Indexer 在微块粒度筛选重要上下文,显著降低长序列 Attention 的计算开销。面对百万级 token 的超长上下文,QSA 的 Attention Kernel 在预填(Prefill)和解码(Decode)阶段分别实现了最高约 7.6 倍和 4.9 倍的加速。 - 残差机制:引入 Gated Residual(GR),将残差流扩展为四条并行分支,并以动态门控控制信息的读写。残差状态支持以 FP8 格式存储,显著减少访存成本。 - Embedding:增加了 51B 参数的 N-gram Embedding,通过局部上下文查表提升模型容量。这部分参数可卸载到主机内存,并通过异步预取与计算重叠,避免长期占用 GPU 显存。 - 优化器与训练策略:采用 Muon Optimizer,并在正交化精度、参数分工与融合矩阵拆分等方面做了针对性优化,同时基于新架构重新拟合了 Scaling Law。

在性能与成本上,相比此前的 Qwen3.7‑Plus,Qwen3.8‑Flash 的训练成本约为其九分之一,但在代码和办公类任务上能力更强。在仅激活 6B 参数的配置下,Qwen3.8‑Flash‑Next‑Base 在 14 个基准测试中有 8 项取得了最优成绩,覆盖包括 MMLU‑Pro、SuperGPQA、BBH、SWEBench‑Pretrain、MGSM 和 MMMU 等测试集。 龙8头号玩家

可用性方面,Qwen3.8‑Flash 即将接入千问 AI 平台并对外开放 API,定价为每百万 Tokens 输入 1 元、输出 3 元。模型权重已在公开社区平台开源,同时发布了 FP8 量化版本。Qwen3.8‑Flash‑Next 默认支持 1M 上下文并内置官方工具,方便开发者使用与适配。