中文

用于对齐语言模型推理能力的自我完善指令调优

计算与语言 2025-01-28 v1

摘要

较小语言模型与较大语言模型之间的推理能力对齐主要通过使用来自稳健大语言模型(LLM)生成的演示进行的监督式微调(SFT)实现。尽管这些方法能够实现更具表现性的模型,但由于仅依赖提供的演示,训练的模型未展现出足够强的泛化能力。在本文中,我们提出了一种自我完善指令调优方法,使较小语言模型能够自我完善其能力。我们的做法基于两个阶段:首先通过指令调优将推理能力从 LLM 传递到小语言模型(SLM),这些模型是由 LLM 提供的演示训练的;随后通过偏好优化策略使已调优模型自我完善其能力。具体而言,第二阶段基于直接偏好优化算法,对SLM进行 refinement heuristics,使其通过自动抽样生成的响应并利用来自 LLM 的 ground truth 提供奖励,以实现一系列推理路径。针对常识推理和数学推理任务的实验结果表明,该方法在 both in-domain 和 out-domain 场景中均显著优于指令调优,成功实现了较小语言模型与较大语言模型之间的推理能力对齐。

关键词

引用

@article{arxiv.2405.00402,
  title  = {Self-Refine Instruction-Tuning for Aligning Reasoning in Language Models},
  author = {Leonardo Ranaldi and Andrè Freitas},
  journal= {arXiv preprint arXiv:2405.00402},
  year   = {2025}
}