中文

Full-Step-DPO: 基于逐步奖励的自监督偏好优化用于数学推理

计算与语言 2025-02-21 v1

摘要

直接偏好优化 (DPO) 在处理长链数学推理时常常面临挑战。现有方法,如 Step-DPO,通常通过聚焦于推理链中的第一个错误步骤来改进这一问题。然而,这些方法忽略了其他所有步骤,并且严重依赖人类或 GPT-4 来识别错误步骤。为此,我们提出了 Full-Step-DPO,一种专为数学推理设计的 novel DPO 框架。它不仅优化第一个错误步骤,而是利用整个推理链中逐步奖励。这通过训练自监督的过程奖励模型来实现,该模型自动为每个步骤提供评分,从而避免依赖外部信号。此外,我们引入了一种新的逐步 DPO 损失函数,该函数根据这些逐步奖励动态更新梯度。这为语言模型提供了更强的推理能力。在多个基础语言模型上,对来自不同领域的数学推理基准进行广泛评估表明,Full-Step-DPO 在性能上优于最新的基线方法。

关键词

引用

@article{arxiv.2502.14356,
  title  = {Full-Step-DPO: Self-Supervised Preference Optimization with Step-wise Rewards for Mathematical Reasoning},
  author = {Huimin Xu and Xin Mao and Feng-Lin Li and Xiaobao Wu and Wang Chen and Wei Zhang and Anh Tuan Luu},
  journal= {arXiv preprint arXiv:2502.14356},
  year   = {2025}
}