人类偏好翻转时:面向 RLHF 的实例依赖鲁棒损失
人工智能
2025-12-02 v1
摘要
数据集的质量在大型语言模型(LLM)对齐中发挥重要作用。然而,在收集人类反馈时,偏好翻转现象十分常见,导致数据标注受污染;这一问题迫切需要具备抗潜在翻转配对鲁棒性的对齐算法。为此,本文提出一种 Flipping-Aware Direct Preference Optimization(FA-DPO)算法,针对来自强化学习与人类反馈(RLHF)视角的人类偏好翻转进行设计。我们将内在的人类意图模型与由外部因素引入的偏好翻转机制分解为两个 distinct 阶段;在后者中,我们在 Bradley-Terry(BT)模型基础上引入实例依赖的翻转概率。进一步地,利用与偏好标注相关的特征,我们捕捉判断不确定性并建模偏好翻转模式。实际中,我们设计一种简单高效的迭代优化算法,兼容原始 RLHF 和 DPO 算法。在实验中,我们在多种情境下评估所提方法,以及其他基线方法。
引用
@article{arxiv.2512.00709,
title = {When Human Preferences Flip: An Instance-Dependent Robust Loss for RLHF},
author = {Yifan Xu and Xichen Ye and Yifan Chen and Qiaosheng Zhang},
journal= {arXiv preprint arXiv:2512.00709},
year = {2025}
}
备注
Accepted by AAAI-26-AIA