效率的提升从不来自堆叠,而来自选择。DSA 做的事情很朴素: 让模型只计算真正需要计算的部分。

01细粒度,是这一版的关键词

与以往粗粒度的注意力近似不同,DSA 在 token 级别对注意力进行选择: 需要精细计算的地方精细计算,不需要的地方跳过。 这让长文本的训练和推理在大幅提速的同时,保持输出效果的稳定。

02严格对齐:效率不以能力换取

为了严谨评估引入稀疏注意力带来的影响,团队特意把 DeepSeek-V3.2-Exp 的训练设置与 V3.1-Terminus 进行了严格对齐。在各领域的公开评测集上, DeepSeek-V3.2-Exp 的表现与 V3.1-Terminus 基本持平。

这句话很重要:效率的提升,不是靠牺牲能力换来的。 当一个版本既更快又能保持同样表现,它才值得被真正用起来。

03开源与算子:两条腿走路

DeepSeek-V3.2-Exp 模型已在 HuggingFace 与魔搭开源:

官方注:在新模型的研究过程中,需要设计和实现很多新的 GPU 算子。 团队使用高级语言 TileLang 进行快速原型开发, 最后以 TileLang 作为精度基线,逐步使用底层语言实现更高效的版本。 因此本次开源的主要算子包含 TileLang 与 CUDA 两种版本。

建议社区在进行研究性实验时,使用基于 TileLang 的版本,以方便调试和快速迭代。

"让效率提升,和让能力提升,本来就不该是两件事。" — DeepSeek V3.2-Exp