中文

显式偏好优化:无需隐式奖励模型

机器学习 2025-06-10 v1 机器学习

摘要

大型语言模型(LLM)的生成响应通常通过称为强化学习从人类反馈(RLHF)的过程进行微调以符合人类偏好。由于 RLHF 依赖复杂的训练序列,即独立学习奖励模型,然后再将其应用于 LLM 策略更新,持续的研究努力旨在寻找更直接的替代方案。就此而言,direct preference optimization(DPO)及其各种衍生方法规避了单独的奖励训练步骤。相反,through the judicious use of a reparameterization trick that induces an 隐式 reward,DPO 和相关方法将学习聚合为单个 loss function 的最小化。尽管在某些实际场景中取得显著成功,但我们证明 DPO 基于目标的目标仍然受到亚最优正则化和 counter-intuitive 插值行为的制约,这些是基于其所依赖的 reparameterizations 所不被注意的 artifacts。为此,我们引入一种称为 EXPO 的 显式 preference optimization 框架,其无需类似的 reparameterization 即可实现隐式 reward。截然不同的是,我们仅从零开始设想直观上令人满意的正则化因子,这些因子透明地避免了关键 DPO 变体的潜在陷阱,证明满足那些先前方法不满足的正则化 desiderata。实证结果支持我们的分析并展示了 EXPO 的有效性。

关键词

引用

@article{arxiv.2506.07492,
  title  = {Explicit Preference Optimization: No Need for an Implicit Reward Model},
  author = {Xiangkun Hu and Lemin Kong and Tong He and David Wipf},
  journal= {arXiv preprint arXiv:2506.07492},
  year   = {2025}
}

备注

arXiv admin note: substantial text overlap with arXiv:2407.09072