AI 对齐的失真:偏好优化是否真的优化了偏好?
机器学习
2025-05-30 v1 计算机科学与博弈论
摘要
在预训练之后,大语言模型基于成对比较与人类偏好进行对齐。最先进的对齐方法(如基于 PPO 的 RLHF 和 DPO)建立在与单一偏好模型对齐的假设之上,尽管它们被部署在用户具有多样化偏好的环境中。因此,这些对齐方法是否能在平均意义上满足用户都不明确——这是多元对齐的最低要求。借鉴社会选择理论并通过个体 Bradley-Terry(BT)模型对用户的比较进行建模,我们引入了对齐方法的失真:最优可实现的平均效用与所学策略的平均效用之间的最坏情况比率。失真的概念有助于区分不同的对齐方法:Nash Learning from Human Feedback 实现了 的极小极大最优失真(对于 BT 温度 ),并且在各种效用分布、比较对分布以及距参考策略的允许 KL 散度下均具有鲁棒性。相比之下,RLHF 和 DPO 在没有 KL 约束时就已经遭受了 的失真,而在完整设置中,根据比较对的采样方式,失真为 甚至无界。
引用
@article{arxiv.2505.23749,
title = {Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?},
author = {Paul Gölz and Nika Haghtalab and Kunhe Yang},
journal= {arXiv preprint arXiv:2505.23749},
year = {2025}
}