超越模仿:从双链思维中学习关键推理步骤的推理蒸馏
计算与语言
2024-05-31 v1 人工智能
摘要
随着大语言模型(LLMs)规模扩大并获得强大的思维链(CoTs)推理能力,实际资源限制促使人们努力将这些能力蒸馏到更紧凑的小语言模型(SLMs)中。我们发现CoTs主要由简单推理形式组成,其中一小部分(约4.7%)的关键推理步骤真正影响结论。然而,先前的蒸馏方法通常仅对教师LLMs产生的正确CoTs数据进行监督微调学生SLMs,导致学生难以学习关键推理步骤,而是模仿教师的推理形式,在这些步骤上出错或遗漏。为了解决这些问题,类比人类学习,根据正确答案分析错误往往能揭示导致成功或失败的关键步骤,我们提出了**错误驱动的关键推理步骤蒸馏(EDIT)**,一种新颖的方法,进一步帮助SLMs学习关键推理步骤,而不仅仅是简单的微调。首先,为了暴露CoTs中的这些关键步骤,我们设计特定提示生成具有相似推理路径但结论不同的双CoTs数据。然后,我们在双CoTs数据上应用最小编辑距离算法来定位这些关键步骤,并优化这些步骤的似然。大量实验验证了EDIT在领域内和领域外基准推理数据集上的有效性。进一步分析表明,EDIT可以生成具有更多正确关键推理步骤的高质量CoTs。值得注意的是,我们还探讨了不同错误模式如何影响性能,并发现EDIT从双CoTs中的逻辑错误中获益多于知识或数学计算错误\footnote{代码可在\url{https://github.com/C-W-D/EDIT}找到。}。
引用
@article{arxiv.2405.19737,
title = {Beyond Imitation: Learning Key Reasoning Steps from Dual Chain-of-Thoughts in Reasoning Distillation},
author = {Chengwei Dai and Kun Li and Wei Zhou and Songlin Hu},
journal= {arXiv preprint arXiv:2405.19737},
year = {2024}
}