中文

在噪声反馈下,偏好优化的泛化能力如何?

机器学习 2026-05-08 v4

摘要

随着大型语言模型(LLM)能力的提升,与人类偏好相匹配变得至关重要。偏好优化通过人类反馈区分受偏好和不受偏好响应来训练模型,已成为对齐 LLM 的关键组成部分。然而,大多数现有工作假设是无噪声反馈,这在人类判断本身固有的错误和不一致性情况下并不现实。本文关注噪声反馈对偏好优化的影响,提供了在此条件下的泛化保证。特别是,我们考虑对应常见现实噪声来源的噪声模型,如误标和不确定性。与传统假设收敛的分析不同,我们关注有限步的偏好优化,为更贴近实际 LLM 训练的直觉提供了新见解。我们描述了在不同噪声类型下,随着噪声率水平、偏好数据分布和样本数量的变化,泛化如何衰减。我们对噪声偏好学习的分析适用于广泛的偏好优化损失函数族,如 DPO、IPO、SLiC 等。在当代 LLM 上进行的经验验证确认了我们的发现的实际相关性,为开发与人类偏好相匹配的 AI 系统提供了宝贵的见解。

关键词

引用

@article{arxiv.2510.01457,
  title  = {A Forensic Analysis of Synthetic Data in RL: Diagnosing and Solving Algorithmic Failures in Model-Based Policy Optimization},
  author = {Brett Barkley and David Fridovich-Keil},
  journal= {arXiv preprint arXiv:2510.01457},
  year   = {2026}
}