11GB 跑 27B 模型:ISTA-DASLab 的 3-Bit GSQ 量化方案

11GB 跑 27B 模型:ISTA-DASLab 的 3-Bit GSQ 量化方案

2026-08-20 · 基于官方模型卡、GSQ 论文 (arXiv:2604.18556) 与实测 config.json 整理

一个让人心动的数字

10.9GB,跑一个 27B 参数的模型。
我在这台双 3090 的工作站上跑过很多 Qwen3.8-27B 的量化版本。从 19.5GB 的 4-bit AutoRound,到各种 GGUF、AWQ、FP8。直到今天在 HuggingFace 上刷到 ISTA-DASLab 放出的新东西——Qwen3.8-27B 的 3-bit GSQ 量化版本,部署时仅占 10.9GB(纯文本模式)。
这意味着什么?如果用它替换我现在的 19.45GB 模型,省下的 8.5GB 显存可以全部给 KV cache,上下文窗口有机会从 100K 冲到 150K 以上。这对本地部署者是实打实的诱惑。

谁做的

ISTA-DASLab,维也纳理工大学的深度学习与稀疏算法实验室。量化圈子里的人对这个名字不陌生——QuIP、QuIP# 这些把极低位量化往前推的工作,很多出自他们。这次他们发布的不是论文附属品,而是一个直接可用的 Qwen3.8-27B 量化权重。
模型卡信息很干净:基于官方 Qwen3.8-27B,量化目标包含 transformer 全量权重、embedding、LM head,vision 组件保留但未校准。

GSQ 是什么

GSQ 的全称是 Gumbel-Softmax Quantization,论文发表在 arXiv:2604.18556。
要理解它,得先说清量化领域的现状。本地推理让”每个参数 2-3 bit”成了标配,但方法分成两派:一派是简单标量量化(GPTQ、AWQ),部署成熟,但在 3-4 bit 精度上触顶;另一派是”第二代”向量或 trellis 量化(QTIP、GPTVQ、AQLM),精度更高,但实现和扩展都难得多。
GSQ 作者问了一个很本质的问题:这个差距是必然的,还是一个精心设计的标量量化器能追回大部分?
答案是后者。GSQ 用 Gumbel-Softmax 对离散网格做松弛优化,让模型在量化时同时学习每个坐标的网格分配和每组尺度,而不是像 RTN 那样简单地四舍五入。论文在 Llama-3.1-8B/70B 上验证,标量量化在低位下的精度天花板被显著抬高。

聪明的量化设计

GSQ 不是一刀切的 3-bit。看它的 config 会发现三个层次的分工:
Transformer 权重用 3-bit GSQ,group size 128。这是主体,也是显存节省的大头。
Embedding 和 LM head 单独用 4-bit RTN,group size 64。这是量化圈公认的”敏感层保护”——输出层和词嵌入对精度影响最大,多给 1 bit 换来输出质量和嵌入保真,代价很小。
Delta 层(线性注意力部分的 in_proj)保留 BF16 不量化。这套 Qwen3.8 混合架构里,线性注意力层对量化特别敏感,保留原精度是稳妥做法——我本地跑的 RedHatAI 4-bit 版本也是同样的策略。

官方精度数据

模型卡给了两个基准,虽然样本少,但结果相当亮眼:
AIME 2025(竞赛级数学),原模型 100.00,3-bit GSQ 100.00——无损。
GPQA Diamond(研究生级科学问答),原模型 89.9,3-bit GSQ 91.41——不降反升 1.5 分。
要注意的是,这两个都是推理类任务。官方没有公布 coding、中文、多模态的完整评测,所以”无损”的结论不宜外推到所有场景。但至少说明:GSQ 在低位量化下的精度控制是真的有东西。

校准集是懂行的

模型卡的校准数据分布很说明问题:Math 13.5%、Code 17.5%、Science 20%、General 12.5%、Multilingual 12.5%、Long context 14%、Agentic trajectories 10%。
注意最后两项——14% 长上下文、10% agentic 轨迹。这是给”把大模型当 agent 用”的人专门准备的。对于跑 coding agent、长文档分析的用户来说,这个校准分布比那些只拿百科文本喂出来的量化模型可靠得多。

vLLM 部署方案(官方流程)

这套权重目前是 vLLM 专属。官方给的流程很明确:

pip install vllm==0.27.1
python patch_vllm_qwen35_embedding.py   # 官方仓库自带的补丁,启用量化后的 embedding 权重

然后直接服务:

vllm serve ISTA-DASLab/Qwen3.8-27B-3Bit-GSQ --reasoning-parser qwen3

纯文本部署(不需要视觉能力)加一行参数,还能再省近 1GB:

vllm serve ISTA-DASLab/Qwen3.8-27B-3Bit-GSQ --reasoning-parser qwen3 --language-model-only

两个注意点:如果重装 vLLM,要重新打补丁;当前版本不支持投机解码(MTP 用不上)。

哪些人值得用

如果你满足以下条件,这个模型很值得一试:跑 vLLM,纯文本为主,显存紧张想塞更大上下文,或者单纯想在 3090 / 4090 这类 24GB 卡上把 27B 模型玩出花样。
哪些人不适合:需要完整视觉能力(vision 未校准)、依赖 SGLang 生态、或者对 3-bit 的速度有顾虑——官方没有公布速度基准,而低位 kernel 的推理速度通常比 4-bit 慢,这点要自己实测。

结语

GSQ 这套方案最大的价值,是证明了一个判断:3-bit 标量量化配合聪明的分策略设计,可以在精度几乎不损失的前提下,把 27B 模型的显存占用压到 11GB 以下。对于本地部署社区,这比堆参数更有意义。
我的工作站用的是 SGLang,目前还用不上它。但我会盯着 ISTA-DASLab——如果哪天他们出一个 4-bit 的 GSQ 变体,我的引擎就能直接吃下这份精度优势了。


参考资料:ISTA-DASLab/Qwen3.8-27B-3Bit-GSQ 模型卡 · GSQ 论文 arXiv:2604.18556(https://arxiv.org/abs/2604.18556)· 实测 config.json(compressed-tensors, num_bits=3, group_size=128)


皖ICP备2025105865号-2|皖公网安备34010402704739号