中文

SPPD:使用动态价值边界的自训练过程偏好学习

人工智能 2025-02-20 v1

摘要

近年来,提升大型语言模型(LLMs)的数值与逻辑推理能力已成为研究热点。现有方法面临若干局限性:推理阶段技术(如思维链)依赖于提示选择与预训练知识;句子级监督微调(SFT)与直接偏好优化(DPO)在逐步数学正确性上存在困难,且依赖于更强模型的蒸馏或人工标注;而强化学习(RL)方法则带来高昂的GPU内存成本与不稳定的训练。为解决这些问题,我们提出了一种结合使用动态价值边界(SPPD)的过程偏好学习的自训练框架。SPPD利用基于过程的马尔可夫决策过程(MDP)与Bellman最优方程,在步级偏好优化上推导出动态价值边界,该方法对模型响应采用基于树的自采样,无需任何来自其他模型的蒸馏。此外,我们在理论上证明了SPPD在奖励约束下等价于同策略策略梯度方法。在7B规模模型上的实验表明,该方法在同域与跨域数学基准测试中均表现出卓越性能。我们在 https://anonymous.4open.science/r/SPPD-DCDD 开源了我们的代码。

关键词

引用

@article{arxiv.2502.13516,
  title  = {SPPD: Self-training with Process Preference Learning Using Dynamic Value Margin},
  author = {Hao Yi and Qingyang Li and Yulan Hu and Fuzheng Zhang and Di Zhang and Yong Liu},
  journal= {arXiv preprint arXiv:2502.13516},
  year   = {2025}
}