RE-PO:鲁棒增强策略优化——LLM 对齐的通用框架
人工智能
2026-03-02 v4
摘要
标准的人类偏好驱动对齐方法,如来自人类反馈的强化学习(RLHF),是将大语言模型(LLMs)与人类价值观对齐的基石。然而,这些方法通常假设偏好数据是干净的,且所有标签同等可靠。在实践中,大规模偏好数据集包含大量噪声,源于标注者错误、不一致的指令、不同的专业水平,甚至是对抗性或低质量的反馈。记录标签与真实偏好之间的这种不匹配可能误导训练并降低模型性能。为解决这一问题,我们提出了鲁棒增强策略优化(RE-PO),它使用期望最大化过程推断每个标签的后验正确性,然后在训练损失中自适应地重新加权数据点以缓解标签噪声。我们进一步通过建立任意偏好损失与其底层概率模型之间的理论联系来推广这一思想,使现有对齐算法能够系统性地转化为鲁棒对应方法,将 RE-PO 从单一方法提升为鲁棒偏好对齐的通用框架。理论上,我们证明在完美校准的模型下,RE-PO 能够恢复数据集的真实噪声水平。经验上,我们证明 RE-PO 一致地改进了四种最先进的对齐方法(DPO、IPO、SimPO 和 CPO);当应用于 Mistral 和 Llama 3 模型时,RE-PO 增强变体在 AlpacaEval 2 胜率上比各自基线提高了最多 7.0%。
引用
@article{arxiv.2509.24159,
title = {RE-PO: Robust Enhanced Policy Optimization as a General Framework for LLM Alignment},
author = {Xiaoyang Cao and Zelai Xu and Mo Guang and Kaiwen Long and Michiel A. Bakker and Yu Wang and Chao Yu},
journal= {arXiv preprint arXiv:2509.24159},
year = {2026}
}