偏好优化中的虚假关联学习:机制、后果及通过平局训练的缓解
机器学习
2026-05-13 v1 人工智能
摘要
偏好学习方法如直接偏好优化(DPO)已知会诱导对虚假关联的依赖,导致当今语言模型出现迎合现象和长度偏好,并可能在未来系统中引发严重的目标误泛化。本文提供了对这一现象的统一理论分析,阐述了虚假学习的机制、部署中的后果以及可证明的缓解策略。聚焦于对数线性策略,我们表明标准偏好学习目标通过两种渠道在人口层面诱导对虚假特征的依赖:均值虚假偏差和因果-虚假关联泄漏。随后我们证明,这种依赖性会创造出不可消除的分布迁移脆弱性:来自相同训练分布的更多数据无法降低模型对虚假特征的依赖。为此,我们提出平局训练(tie training),一种利用平局(相等效用偏好对)进行数据增强的策略,以引入数据驱动的正则化。我们展示了该方法能够在不损害因果学习的前提下选择性地减少虚假学习。最后,我们在对数线性模型上验证了理论,并在神经网络和大型语言模型上提供了实证证据,表明虚假学习机制及平局训练的优势在这些模型中同样有效。
引用
@article{arxiv.2605.11134,
title = {Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training},
author = {Christian Moya and Alex Semendinger and Guang Lin and Elliott Thornley},
journal= {arXiv preprint arXiv:2605.11134},
year = {2026}
}
备注
Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea