揭示思维链推理蒸馏的关键因素
计算与语言
2025-05-28 v3
摘要
大型语言模型(LLMs)通过思维链(CoT)提示在推理任务中表现出色。然而,思维链提示极大地增加了计算需求,这促使人们越来越关注将思维链能力蒸馏到小型语言模型(SLMs)中。本研究系统地考察了影响思维链蒸馏的因素,包括粒度、格式和教师模型的选择。通过涉及四个教师模型和七个学生模型在七个数学和常识推理数据集上的实验,我们发现了三个关键发现:(1)与LLMs不同,SLMs与粒度呈非单调关系,更强的模型受益于更细粒度的推理,而较弱的模型在更简单的思维链监督下表现更好;(2)思维链格式对LLMs影响显著,但对SLMs影响甚微,这可能是由于它们依赖监督微调而非预训练偏好;(3)更强的教师模型并不总是产生更好的学生模型,因为思维链监督的多样性和复杂性可能比单纯的准确性更重要。这些发现强调需要针对特定学生模型定制思维链策略,为优化SLMs中的思维链蒸馏提供了可操作的见解。代码和数据集可在 https://github.com/EIT-NLP/Distilling-CoT-Reasoning 获取。
引用
@article{arxiv.2502.18001,
title = {Unveiling the Key Factors for Distilling Chain-of-Thought Reasoning},
author = {Xinghao Chen and Zhijing Sun and Wenjin Guo and Miaoran Zhang and Yanjun Chen and Yirong Sun and Hui Su and Yijie Pan and Dietrich Klakow and Wenjie Li and Xiaoyu Shen},
journal= {arXiv preprint arXiv:2502.18001},
year = {2025}
}
备注
ACL 2025 Findings