点石成金:利用负数据从 LLM 中蒸馏复杂推理能力
计算与语言
2023-12-21 v1 人工智能
摘要
大型语言模型 (LLM) 在各种推理任务上表现优异,但其不可访问性和海量参数阻碍了在实际中的广泛应用。一种有前景的方法是通过生成的思维链推理路径,将 LLM 的推理能力蒸馏到小模型中。然而在某些情况下,LLM 可能会产生错误的推理链,特别是在面对复杂的数学问题时。以往的研究仅从正样本中迁移知识,并丢弃答案错误的合成数据。在本工作中,我们阐明了负数据的价值,并提出一个模型特化框架,在正样本之外利用负样本对 LLM 进行蒸馏。该框架包含三个渐进的步骤,涵盖从训练到推理阶段,以从负数据中吸收知识。我们在算术推理任务上进行了广泛实验,以展示负数据在 LLM 蒸馏中的作用。
引用
@article{arxiv.2312.12832,
title = {Turning Dust into Gold: Distilling Complex Reasoning Capabilities from LLMs by Leveraging Negative Data},
author = {Yiwei Li and Peiwen Yuan and Shaoxiong Feng and Boyuan Pan and Bin Sun and Xinglin Wang and Heda Wang and Kan Li},
journal= {arXiv preprint arXiv:2312.12832},
year = {2023}
}
备注
AAAI 2024