DART:将自回归推理蒸馏为静默思维
计算与语言
2025-08-29 v2
摘要
思维链推理显著推进了大语言模型(LLMs)在解决复杂任务方面的能力。然而,其自回归范式导致了显著的计算开销,阻碍其在延迟敏感应用中的部署。为此,我们提出了DART(Distilling Autoregressive Reasoning to Silent Thought),一种自蒸馏框架,使LLMs能够用非自回归的静默思维(ST)替代自回归的CoT。具体而言,DART引入了两条训练路径:CoT路径用于传统推理,ST路径用于从少量ST标记直接生成答案。ST路径利用轻量级的推理演化模块(REM)将其隐藏状态与CoT路径对齐,使ST标记能够演化为信息丰富的嵌入。在推理过程中,仅激活ST路径,利用演化的ST标记直接提供答案。广泛的实验结果表明,DART相比现有的非自回归基线方法提供了显著的性能提升,且没有额外的推理延迟,作为高效推理的可行替代方案。
引用
@article{arxiv.2506.11752,
title = {DART: Distilling Autoregressive Reasoning to Silent Thought},
author = {Nan Jiang and Ziming Wu and De-Chuan Zhan and Fuming Lai and Shaobing Lian},
journal= {arXiv preprint arXiv:2506.11752},
year = {2025}
}