效率的提升从不来自堆叠,而来自选择。DSA 做的事情很朴素: 让模型只计算真正需要计算的部分。
01细粒度,是这一版的关键词
与以往粗粒度的注意力近似不同,DSA 在 token 级别对注意力进行选择: 需要精细计算的地方精细计算,不需要的地方跳过。 这让长文本的训练和推理在大幅提速的同时,保持输出效果的稳定。
02严格对齐:效率不以能力换取
为了严谨评估引入稀疏注意力带来的影响,团队特意把 DeepSeek-V3.2-Exp 的训练设置与 V3.1-Terminus 进行了严格对齐。在各领域的公开评测集上, DeepSeek-V3.2-Exp 的表现与 V3.1-Terminus 基本持平。
03开源与算子:两条腿走路
DeepSeek-V3.2-Exp 模型已在 HuggingFace 与魔搭开源:
- HuggingFace:deepseek-ai/DeepSeek-V3.2-Exp
- ModelScope:deepseek-ai/DeepSeek-V3.2-Exp
- 论文:DeepSeek_V3_2.pdf
官方注:在新模型的研究过程中,需要设计和实现很多新的 GPU 算子。
团队使用高级语言 TileLang 进行快速原型开发,
最后以 TileLang 作为精度基线,逐步使用底层语言实现更高效的版本。
因此本次开源的主要算子包含 TileLang 与 CUDA 两种版本。
建议社区在进行研究性实验时,使用基于 TileLang 的版本,以方便调试和快速迭代。
"让效率提升,和让能力提升,本来就不该是两件事。" — DeepSeek V3.2-Exp