双头推理蒸馏:以仅训练时推理提升分类器准确率
计算与语言
2025-09-30 v2 人工智能
摘要
思维链(CoT)提示通常能提升分类准确率,但推理生成理由会带来显著的吞吐量惩罚(Wei et al., 2022; Cheng and Van Durme, 2024)。为解决这一权衡,我们提出了双头推理蒸馏(DHRD),一种面向仅解码器语言模型(LMs)的简单训练方法,其添加(i)一个在训练和推理时均使用的池化分类头,以及(ii)一个仅在训练时由教师理由监督的推理头。我们使用标签交叉熵与输入加理由序列上的逐词语言模型损失的加权和作为损失函数。在七个 SuperGLUE 任务上,DHRD 相对于池化基线取得了 0.65–5.47% 的相对提升,在蕴含/因果任务上提升尤为显著。由于我们在测试时禁用了推理头,推理吞吐量与池化分类器一致,且在同一骨干网络上超过 CoT 解码 96–142 倍(QPS)。
引用
@article{arxiv.2509.21487,
title = {Dual-Head Reasoning Distillation: Improving Classifier Accuracy with Train-Time-Only Reasoning},
author = {Jillian Xu and Dylan Zhou and Vinay Shukla and Yang Yang and Junrui Ruan and Shuhuai Lin and Wenfei Zou and Yinxiao Liu and Karthik Lakshmanan},
journal= {arXiv preprint arXiv:2509.21487},
year = {2025}
}
备注
39th Conference on Neural Information Processing Systems (NeurIPS 2025) Efficient Reasoning Workshop