AlphaPO:奖励函数形状对LLM对齐的影响
计算与语言
2025-06-02 v4
摘要
基于人类反馈的强化学习(RLHF)及其变体取得了快速进展,以有效地将大型语言模型(LLM)对齐以遵循指令并反映人类价值观。更近期地,直接对齐算法(DAAs)出现,其方法是通过刻画奖励直接作为所学习的策略函数来跳过RLHF的奖励建模阶段。其中一些流行的DAAs示例包括直接偏好优化(DPO)和简单偏好优化(SimPO)。这些方法常常存在似然位移(likelihood displacement)问题,即优先响应的概率会被不希望地降低。本文我们认为,对于DAAs,奖励(函数)的形状很重要。我们引入了AlphaPO,这是一种新的DAA方法,利用α参数来改变标准对数奖励之外的奖励函数形状。AlphaPO有助于对似然位移和过度优化保持细粒度控制。相对于SimPO——这是表现最好的DAAs之一——AlphaPO在Mistral-7B和Llama3-8B的指令版本上实现了约7%至10%的相对对齐性能提升,相对于DPO可实现15%至50%的相对提升。所呈现的分析和结果凸显了奖励函数形状的重要性,以及如何系统性地改变其以影响训练动力学并提高对齐性能的方法。
引用
@article{arxiv.2501.03884,
title = {AlphaPO: Reward Shape Matters for LLM Alignment},
author = {Aman Gupta and Shao Tang and Qingquan Song and Sirou Zhu and Jiwoo Hong and Ankan Saha and Viral Gupta and Noah Lee and Eunki Kim and Siyu Zhu and Parag Agrawal and Natesh Pillai and S. Sathiya Keerthi},
journal= {arXiv preprint arXiv:2501.03884},
year = {2025}
}
备注
26 pages, 16 figures. Accepted to ICML 2025