中文

直接密度比优化:一种严格统计一致的大语言模型对齐方法

机器学习 2025-05-21 v2 计算与语言 机器学习

摘要

与人类偏好相匹配的大语言模型(LLM)对于安全部署至关重要,但现有方法假设特定的偏好模型(如 Bradley-Terry 模型),导致统计不一致,即更多数据不一定收敛到真实人类偏好。为解决这一关键问题,我们引入一种新颖的对齐方法:直接密度比优化(DDRO)。DDRO directly 估计首选输出分布与不首选输出分布之间的密度比,无需显式建模人类偏好。我们在理论上证明了 DDRO 的统计一致性,确保随数据规模增大而收敛到真实首选分布,无论底层偏好结构如何。实验表明,DDRO 在众多主要基准测试上实现了优异性能。DDRO 解锁了数据驱动对齐的潜力,为实现更可靠、更贴近人类的 LLM 铺平了道路。

关键词

引用

@article{arxiv.2505.07558,
  title  = {Direct Density Ratio Optimization: A Statistically Consistent Approach to Aligning Large Language Models},
  author = {Rei Higuchi and Taiji Suzuki},
  journal= {arXiv preprint arXiv:2505.07558},
  year   = {2025}
}