用于卓越长思维链推理的分布对齐序列蒸馏
机器学习
2026-01-15 v1 计算与语言
摘要
在本报告中,我们介绍了 DASD-4B-Thinking,一个轻量级但功能强大、完全开源的推理模型。在数学、科学推理和代码生成等具有挑战性的基准测试中,它在同等规模的开源模型中取得了 SOTA 性能——甚至超越了一些更大的模型。我们首先批判性地重新审视了社区中广泛采用的蒸馏范式:在教师生成的响应上进行 SFT,也称为序列级蒸馏。尽管最近一系列遵循该方案的工作展示了显著的效率和强大的实证性能,但它们主要基于 SFT 视角。因此,这些方法主要集中在设计用于 SFT 数据过滤的启发式规则上,而在很大程度上忽略了蒸馏本身的核心原则——使学生模型学习教师的完整输出分布,从而继承其泛化能力。具体而言,我们指出了当前实践中的三个关键局限性:i) 对教师序列级分布的表示不充分;ii) 教师的输出分布与学生的学习能力之间的错配;iii) teacher-forced 训练与自回归推理之间产生的曝光偏差。总而言之,这些缺陷反映了在整个蒸馏过程中系统性地缺乏显式的师生交互,使得蒸馏的本质未被充分利用。为了解决这些问题,我们提出了几项方法论创新,共同构成了一个增强的序列级蒸馏训练流水线。值得注意的是,DASD-4B-Thinking 仅使用 448K 训练样本便获得了有竞争力的结果——比大多数现有开源工作所使用的样本少了一个数量级。为了支持社区研究,我们公开发布了我们的模型和训练数据集。
引用
@article{arxiv.2601.09088,
title = {Distribution-Aligned Sequence Distillation for Superior Long-CoT Reasoning},
author = {Shaotian Yan and Kaiyuan Liu and Chen Shen and Bing Wang and Sinan Fan and Jun Zhang and Yue Wu and Zheng Wang and Jieping Ye},
journal= {arXiv preprint arXiv:2601.09088},
year = {2026}
}
备注
Project Page: https://github.com/D2I-ai/dasd-thinking