中文

PaD:程序辅助蒸馏比思维链微调更能教会小模型推理

计算与语言 2024-03-21 v2

摘要

尽管大语言模型(LLMs)在各种自然语言处理任务中表现出色,但其庞大的规模与参数的不可访问性为实际部署带来挑战。先前研究尝试通过数据合成与思维链(CoT)微调将特定任务能力从 LLMs 蒸馏至更小模型。然而,合成的 CoT 数据常包含错误推理,这会劣化蒸馏质量,尤其在推理能力方面。本工作中,我们提出程序辅助蒸馏(PaD),其引入推理程序以抑制蒸馏数据中的错误,从而在推理任务上取得更优蒸馏质量。在 PaD 中,我们利用推理程序替代 CoT,实现对合成数据的自动错误检查。进一步,通过错误注入与后续训练,小蒸馏模型可迭代式自我精炼推理。此外,我们执行逐步束搜索,通过逐步验证获取更精确的推理链。我们在算术推理、符号推理与通用能力上评估 PaD。实验结果表明,采用 PaD 的更小模型不仅能优于某些 LLMs(如 LLaMA-1 13B),还能以显著更少的参数与数据规模相较基线实现强劲提升。源代码公开于 https://github.com/Xuekai-Zhu/pad。

关键词

引用

@article{arxiv.2305.13888,
  title  = {PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning},
  author = {Xuekai Zhu and Biqing Qi and Kaiyan Zhang and Xinwei Long and Zhouhan Lin and Bowen Zhou},
  journal= {arXiv preprint arXiv:2305.13888},
  year   = {2024}
}

备注

NAACL 2024 Long Paper; Code and data are available at https://github.com/Xuekai-Zhu/pad