中文

相对密度比优化:实现稳定且统计一致的模型对齐

机器学习 2026-04-07 v1 人工智能 计算与语言 机器学习

摘要

将语言模型与人类偏好对齐对于确保其安全性和可靠性至关重要。尽管大多数现有方法假设了特定的人类偏好模型(如 Bradley-Terry 模型),但该假设可能无法准确捕捉真实的人类偏好,因此这些方法缺乏统计一致性,即保证语言模型随样本数量增加而收敛到真实人类偏好。相比之下,直接密度比优化(DDRO)在不假设任何人类偏好模型的情况下实现了统计一致性。DDRO 使用语言模型对偏好数据分布与非偏好数据分布之间的密度比进行建模,然后通过密度比估计对其进行优化。然而,该密度比不稳定且经常发散,导致 DDRO 训练不稳定。在本文中,我们提出了一种既稳定又统计一致的新对齐方法。我们的方法基于偏好数据分布与偏好和非偏好数据分布混合之间的相对密度比。我们的方法是稳定的,因为该相对密度比有上界且不会发散。此外,它是统计一致的,并且提供了比 DDRO 显著更紧的收敛保证。我们通过 Qwen 2.5 和 Llama 3 实验证明了其有效性。

关键词

引用

@article{arxiv.2604.04410,
  title  = {Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment},
  author = {Hiroshi Takahashi and Tomoharu Iwata and Atsutoshi Kumagai and Sekitoshi Kanai and Masanori Yamada and Kosuke Nishida and Kazutoshi Shinoda},
  journal= {arXiv preprint arXiv:2604.04410},
  year   = {2026}
}

备注

Code is available at https://github.com/takahashihiroshi/rdro