迭代 DPO:全面经验性调查 LLM 推理能力
计算与语言
2025-07-29 v3
摘要
最近的大语言模型 (LLM) 后训练方法突破,突显强化学习 (RL) 作为增强推理能力的关键组件。然而,RL 基于方法的计算成本高昂,导致越来越多地关注替代范式,如直接偏好优化 (DPO)。本研究我们检验 DPO 在通过迭代偏好学习促进 LLM 自我完善方面的有效性。我们展示,单轮带粗筛选的 DPO 可显著提升数学推理性能,尤其是针对强基线模型。此外,我们设计了一个用于生成器和奖励模型 (RM) 的迭代增强框架,使其能够通过多轮 DPO 的在线交互实现相互改进。最后,通过简单可验证的奖励,我们的模型 DPO-VP 达到了与 RL 相当的性能,同时计算开销显著降低。这一发现突显 DPO 作为 RL 的可扩展且高性价比的替代方案,为资源受限环境下的 LLM 推理增强提供了实用解决方案。
引用
@article{arxiv.2503.12854,
title = {Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation},
author = {Songjun Tu and Jiahao Lin and Xiangyu Tian and Qichao Zhang and Linjing Li and Yuqian Fu and Nan Xu and Wei He and Xiangyuan Lan and Dongmei Jiang and Dongbin Zhao},
journal= {arXiv preprint arXiv:2503.12854},
year = {2025}
}
备注
23pages