中文

DPO 能否学习多样化的人类价值?一个理论尺度律

机器学习 2025-10-16 v5

摘要

大型语言模型(LLMs)已展现出惊人的能力,但常常难以与人类偏好相一致,导致产生有害或不可取的输出。基于人类反馈训练模型以区分受偏好和不受偏好的响应,以实现与人类价值相符的目标,已成为确保 LLMs 与人类价值相符的关键组件。确保 LLMs 能满足所有人的重要一步是考虑到多样化的价值集合。这篇论文引入了新的理论框架来分析在使用直接偏好优化训练的模型中,价值多样性和样本数量如何影响泛化。我们的框架严格评估了在有限数量的梯度步骤后,模型如何泛化,反映了现实中的 LLM 训练实践。通过分析每个样本及其在训练期间轨迹相关的奖励边际,我们提供了一个泛化误差上界,说明在有效学习广泛概念或价值方面的挑战。这些见解在当代 LLMs 上进行了经验验证,凸显了我们的理论在实际中的相关性。

关键词

引用

@article{arxiv.2408.03459,
  title  = {Can DPO Learn Diverse Human Values? A Theoretical Scaling Law},
  author = {Shawn Im and Sharon Li},
  journal= {arXiv preprint arXiv:2408.03459},
  year   = {2025}
}

备注

NeurIPS 2025