中文

自我改进鲁棒偏好优化

机器学习 2025-04-15 v4 人工智能 机器学习

摘要

在线和离线RLHF方法,如PPO和DPO,在将AI与人类偏好对齐方面非常成功。然而,尽管取得了成功,这些方法存在根本性限制:(a) 使用RLHF训练的模型可以在训练期间通过RL机制或对比损失从错误或负面例子中学习。然而,在推理时,它们缺乏用于错误纠正的内在自我改进机制。(b) 现有方法的最优解高度依赖于任务,使得它们难以推广到新任务。为了解决这些挑战,我们提出了自我改进鲁棒偏好优化(SRPO),一个实用且数学上有原则的离线RLHF框架。SRPO背后的关键思想是将从人类偏好学习的问题视为一个自我改进过程,数学上形式化为一个最小-最大目标,该目标以对抗方式联合优化自我改进策略和生成策略。关键的是,该优化问题的解独立于训练任务,使其对任务变化具有鲁棒性。然后我们证明这个目标可以重新表述为一个非对抗的离线损失,可以使用标准的监督学习技术在大规模上高效优化。为了展示SRPO的有效性,我们使用AI胜率(WR)与人类(GOLD)完成进行比较。在XSum数据集上测试时,SRPO在5次自我修订后比DPO高出15%,达到了令人印象深刻的90% WR。此外,在具有挑战性的Arena-Hard提示上,SRPO优于DPO和IPO(无修订时高出4%,单次修订后高出6%),达到了56%的WR,与Llama-3.1-8B-Instruct相比。

关键词

引用

@article{arxiv.2406.01660,
  title  = {Self-Improving Robust Preference Optimization},
  author = {Eugene Choi and Arash Ahmadian and Matthieu Geist and Oilvier Pietquin and Mohammad Gheshlaghi Azar},
  journal= {arXiv preprint arXiv:2406.01660},
  year   = {2025}
}