中文

面向数学推理的大语言模型双向指令微调

计算与语言 2024-03-28 v1

摘要

最近的进展凸显了利用思维链数据对大语言模型(LLM)进行指令微调在数学推理任务上的成功。尽管经过微调,LLM 仍面临挑战,例如思维链生成中存在错误、遗漏和冗余步骤,导致答案预测不准确。为了缓解这一问题,我们提出了一种双向指令微调策略,从正向和反向精心建模数学推理。这涉及引入中间推理状态预测任务(正向推理)和指令重构任务(反向推理),以增强 LLM 对指令的理解和执行能力。这些任务的训练实例基于现有的数学指令微调数据集构建。随后,使用现有的数学指令和新建数据对 LLM 进行多任务微调。综合实验验证了双向指令微调策略在各种数学推理任务上的有效性和领域泛化能力。

关键词

引用

@article{arxiv.2403.18295,
  title  = {Dual Instruction Tuning with Large Language Models for Mathematical Reasoning},
  author = {Yongwei Zhou and Tiejun Zhao},
  journal= {arXiv preprint arXiv:2403.18295},
  year   = {2024}
}