偏好学习从两两比较数据中能恢复什么?
机器学习
2026-02-12 v1
摘要
两两偏好学习是机器学习的核心问题,近年来在与人类偏好对齐语言模型方面得到广泛应用。典型的数据集由三元组 组成,其中响应 相对于情境 被偏好于响应 。布拉德利-蒂尔 (Bradley--Terry, BT) 模型是主要采用的方法,将偏好概率建模为潜在得分差异的函数。标准做法假设数据遵循该模型,据此学习潜在得分。然而,现实数据可能违反此假设,仍不清楚 BT 学习在此类情况下会恢复什么。本文从三元组比较数据出发,通过条件偏好分布 (Conditional Preference Distribution, CPRD) 形式化偏好信息的编码方式。我们给出 BT 模型用于建模 CPRD 的精确条件,并识别影响样本效率的关键因素——即间隔 (margin) 和连通性 (connectivity)。这些结果为理解偏好学习实际恢复的内容提供了数据导向的基础。
引用
@article{arxiv.2602.10286,
title = {What Does Preference Learning Recover from Pairwise Comparison Data?},
author = {Rattana Pukdee and Maria-Florina Balcan and Pradeep Ravikumar},
journal= {arXiv preprint arXiv:2602.10286},
year = {2026}
}