Qwen3.8-Flash-Next:Qwen4 架构先行者,6B 激活打 27B
当大模型的竞赛从”谁能做得更大”转向”谁能在有限算力下做得更聪明”,Qwen 交出了一份特别的答卷。Qwen3.8-Flash-Next——一个 125B 参数、但只有 6B 被激活的实验性架构预览——刚刚开源。它在 20/21 项基准上击败了自家上一代满血的 27B 旗舰,而推理成本却低一个数量级。这篇文章基于官方发布材料,拆解它凭什么。
一、这是一次”架构预告”,不是一个常规新模型
Qwen3.8-Flash-Next 的特殊之处在于它的定位:这是 Qwen4 架构的实验性预览(experimental preview),不是一个简单的”更大更强”的迭代款。官方明确说,它承载的是对现代大语言模型核心组件在规模下如何交互的一次根本性重构。
为什么值得关注?因为当模型的参数量从百亿迈向千亿、上下文从几十万走向百万,传统的”堆参数”路线遇到了两个硬约束:算力成本和内存瓶颈。Qwen3.8-Flash-Next 的思路是:用架构创新绕开这两个约束,而不是硬扛。
二、规格速览:一个反直觉的数字游戏
先看最让人惊讶的一组数字:
| 指标 | Qwen3.8-Flash-Next | Qwen3.8-27B |
|---|---|---|
| 总参数 | 125B + 51B n-gram embedding + 4B MTP | 27B |
| 激活参数 | 6B | 27B |
| 隐藏维度 | 2560 | 5120 |
| 层数 | 48 | 64 |
| 上下文 | 262,144 原生,可扩展至 1,000,000 | 262,144 |
125B 总参数里只有 6B 被激活——这是 MoE(混合专家)思路的极致化:每个 token 只经过一小部分参数。就像一家千人的公司,每次决策只需要 6 个人参与,但背后有 125 人的智囊团支撑。
6B 激活意味着什么?推理时的计算量(FLOPs)和内存带宽需求大幅下降。这是它能”小而快”的根本原因。
三、三大架构创新:都在为”效率”服务
官方介绍了三项核心创新,每一项都指向”如何在有限资源下榨取更多智能”。
1. QSA 稀疏注意力:从”选 token”到”选块”
Qwen3.8 时代用的是 Gated DeltaNet(线性注意力)+ Gated Attention(稀疏注意力)的组合。Qwen3.8-Flash-Next 把后者升级成了 Qwen Sparse Attention(QSA)——最大的变化是粒度:
以前的稀疏注意力:逐 token 挑选哪些需要关注(细但开销大)。QSA:以 micro-block(微块) 为单位选择性处理(粗但省得多)。
官方明确说,这大幅削减了长上下文的延迟——对日益主流的 agent 工作负载(需要大量长上下文来回)是直接利好。QSA 的索引器结构:4 个 Query Head + 1 个共享 Key Head,预算 512 块或 2048 tokens。
2. N-gram Embedding:把”记忆”从计算里剥离出来
这是最反直觉的创新。传统 LLM 的 embedding 层就是一张巨大的查找表,参数量随着词表线性膨胀,且每个 token 都要全量查一遍。
Qwen3.8-Flash-Next 引入了 N-gram Embedding:20,000,000 个 bigram/trigram 条目(在 layer 2),共 51B 参数。它的巧妙之处在于:
比 MoE 更利于 offload:embedding 是”按索引取数”,天然适合放到内存/SSD,不需要高速显存。参数膨胀但不涨计算:多出的 51B 参数只在”查表”时需要,不参与矩阵乘。为内存受限的加速器设计:官方原文直指这是为了”memory-constrained accelerators”。
这意味着:模型的”记忆容量”和”计算需求”第一次解耦了。你可以拥有一个”知识量很大但算起来很便宜”的模型。
3. Gated Residual:加宽残差流,不添乱
第三个创新是 Gated Residual:残差流用归一化保证深度训练的稳定性,而 Gated Residual 通过逐元素的 data-dependent 读门 + 每分支的标量写门,调制经过加宽残差流的信息。4 个分支,瓶颈秩 320。换来的是层间更细粒度的表达能力,同时推理开销保持低位。
附赠:Muon + AdamW 混合优化器
训练配方上也做了创新:不同权重类别用 Muon 和 AdamW 两种优化器,基于重拟合的缩放定律直接跳过 batch size 预热,用更大的学习率减少优化器步数。
四、成绩单:6B 激活如何打赢 27B 满血
这是最硬核的部分。官方对比了 Qwen3.8-Flash-Next、自家 Qwen3.8-27B、Qwen3.7-Plus、DeepSeek-V4-Flash 和 Claude-Opus-4.6:
编码与 Agent 场景(Flash-Next 全面领先):
| 基准 | Flash-Next | Qwen3.8-27B | 说明 |
|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | agentic coding,+16.5 分碾压 |
| SWE-bench Pro | 62.5 | 61.7 | 软件工程 |
| SWE-bench Multilingual | 81.0 | 73.8 | 多语言工程 |
| NL2Repo-Bench | 48.1 | 42.3 | 仓库级代码生成 |
| JobBench | 55.7 | 33.4 | 职业任务,+22.3 分 |
| CoWorkBench | 73.9 | 70.7 | 长程办公 |
| Agents’ Last Exam | 51.2 | 42.9 | 前沿 agent 任务 |
| Toolathlon Verified | 73.5 | 67.1 | 真实工具使用 |
| LiveCodeBench v6 | 91.9 | 90.3 | 竞赛编程 |
通用与推理:
| 基准 | Flash-Next | Qwen3.8-27B |
|---|---|---|
| IFBench (指令遵循) | 81.3 | 79.5 |
| GPQA Diamond (科学推理) | 91.7 | 89.2 |
| HLE (多学科推理) | 35.9 | 30.8 |
| MathVision (视觉数学, With CI) | 95.7 | 94.6 |
多模态 Agent(同为全面领先):
ClawEval-MM 平均分 60.4 vs 56.9。AndroidWorld 84.5 vs 81.9。OSWorld 2.0 (Partial) 52.3 vs 48.0。Vision2Web 64.0 vs 62.9。ERQA 72.3 vs 65.5。LVBench 76.6 vs 72.4。RealWorldQA 88.5 vs 85.9。CharXiv (With CI) 90.6 vs 90.2。
统计:21 项对比中 Flash-Next 领先 20 项,仅 NL2Repo-Bench 一项略输给 DeepSeek-V4-Flash(48.1 vs 54.2)。
重点看 DeepSWE 1.1 的 +16.5 分和 JobBench 的 +22.3 分——在 agent 类任务上的碾压式领先,正是 6B 激活 + 长上下文 + QSA 稀疏注意力三者叠加的直接红利:推理快、上下文长、还能在长程任务中保持注意力质量。
五、部署形态:官方全家桶 + 各框架已跟进
官方给出三套部署路径,且刚发布就已经全面适配:
SGLang:官方 cookbook 已发布(docs.sglang.io)。vLLM:官方 recipe 已就绪。TokenSpeed:已支持。Qwen Cloud API:想要生产级特性(1M 默认上下文、内置工具)可以直接用 Qwen3.8-Flash(基于本模型的官方版本)。
权重格式:Transformers 兼容,Qwen4ExpForConditionalGeneration 架构,多模态(视觉编码器)。上下文 262,144 原生,可扩到 1,000,000。
有意思的是,社区量化也跟上来了——unsloth 已发布 GGUF 系列,从 UD-IQ1(1bit,~72GB)到 UD-Q4(~111GB)。2bit 的 UD-Q2_K_XL 约 78.9GB——即便 2bit 也放不进单张 24GB 卡,因为 51B n-gram embedding 是总参数的主要负担(虽然它可以 offload 到内存)。这台 125B 巨兽,本地跑至少需要 80GB+ 显存或依赖 SSD offload 方案。
六、思考:这指向了什么样的未来
Qwen3.8-Flash-Next 释放的信号比模型本身更值得玩味:
一、”激活参数”正在取代”总参数”成为衡量模型的新标尺。6B 激活打平甚至超越 27B 满血,说明”算得便宜 + 记得多”才是下一代模型的设计哲学。总参数继续膨胀(用来记忆),激活参数维持低位(用来控制成本)。
二、N-gram embedding 把”记忆”和”计算”彻底解耦。这是为”内存受限加速器”(手机、边缘设备、本地工作站)铺路的关键一步——51B 的”知识库”可以放内存甚至 SSD,6B 的”大脑”留在显存里。这比 MoE 更彻底的稀疏化方向。
三、Agent 工作负载是主战场。从 benchmark 的分布看,官方把最多的筹码押在了 agentic coding、长程任务、工具使用上——这些恰恰是长上下文 + 高效推理最能发挥的场景。QSA 的”按块稀疏”设计,就是为海量 agent 请求准备的低延迟方案。
四、架构创新周期在加速。从 Qwen3.8 的 GDN 混合注意力,到 Qwen3.8-Flash-Next 的 QSA + N-gram embedding,Qwen 团队明显在为一个”不靠堆算力”的 Qwen4 做技术储备。当别的团队还在比拼谁的单卡装得下更大的模型时,Qwen 选择了一条”让模型在更小算力上更聪明”的路线。
对本地部署玩家来说,好消息是:这个架构天然亲近”内存大、显存小”的机器。坏消息是:51B 的 n-gram embedding 让它的总参数规模远超单卡承载,短期内 24GB 用户还是得靠 27B 级别模型——但那颗”6B 激活”的心,已经在为下一代本地硬件探路了。
本文基于 Qwen3.8-Flash-Next 官方 HuggingFace 模型卡与 README 编写,benchmark 数据为官方口径。模型:huggingface.co/Qwen/Qwen3.8-Flash-Next。更多细节见官方博客与技术报告。
