中文

从噪声偏好中学习:面向直接偏好优化的半监督学习方法

计算机视觉与模式识别 2026-04-29 v1 人工智能

摘要

人类视觉偏好本质上是多维的,涵盖审美、细节保真度和语义对齐等方面。然而,现有数据集仅提供单一的整体标注,导致严重的标签噪声:在某些维度上表现优异但在其他维度上存在不足的图像仅被标记为胜者或输者。我们在理论上表明,将多维偏好压缩为二元标签会产生冲突的梯度信号,误导扩散直接偏好优化 (DPO)。为此,我们提出 Semi-DPO,一种半监督方法,将一致的配对视为干净的标注数据,将冲突的配对视为噪声的无标签数据。该方法首先在经共识过滤的干净子集上进行训练,然后将该模型作为隐式分类器,用于为噪声集合生成伪标签以进行迭代细化。实验结果表明,Semi-DPO 实现了最先进的性能,显著提升了与复杂人类偏好的对齐度,无需额外的人类标注或显式奖励模型即可完成训练。我们将在 https://github.com/L-CodingSpace/semi-dpo 上发布代码和模型。

关键词

引用

@article{arxiv.2604.24952,
  title  = {Learning from Noisy Preferences: A Semi-Supervised Learning Approach to Direct Preference Optimization},
  author = {Xinxin Liu and Ming Li and Zonglin Lyu and Yuzhang Shang and Chen Chen},
  journal= {arXiv preprint arXiv:2604.24952},
  year   = {2026}
}