中文

差分投票:用于异质偏好公理化多样聚合的损失函数

计算机科学与博弈论 2026-01-28 v1 人工智能

摘要

基于人类反馈的强化学习(RLHF)将异质的人类偏好隐式聚合为单一效用函数,尽管在实践中参与者的潜在效用是多样的。因此,RLHF 可被视为一种投票形式,其聚合机制由损失函数定义。尽管 Arrow 不可能性定理表明不同的机制满足不同的理想公理集,但现有大多数方法依赖单一聚合原则,通常是 Bradley-Terry-Luce(BTL)模型,对应于 Borda 计数投票。这限制了所学奖励的公理性质,并掩盖了嵌入在优化中的规范性假设。在本工作中,我们引入了差分投票,这是一个统一框架,用于构建逐实例的、可微的损失函数,其总体最优解可证明对应于不同的经典投票规则。我们开发了基于多数的聚合(BTL)、Copeland 和 Kemeny 规则的可微替代函数,并正式分析了它们的校准性质、梯度场以及平滑参数趋于零时的极限行为。对于每种损失,我们建立了其与相应社会选择规则的一致性,并刻画了其满足或违背的公理。我们的分析表明,损失几何中的设计选择——如间隔敏感性和边界集中度——如何直接转化为规范的聚合行为。差分投票使偏好聚合成为 RLHF 中明确且可控的设计选择,实现了公理化保证与优化稳定性之间的有原则权衡。用于复现我们实验的代码已开源。

关键词

引用

@article{arxiv.2601.18824,
  title  = {Differential Voting: Loss Functions For Axiomatically Diverse Aggregation of Heterogeneous Preferences},
  author = {Zhiyu An and Duaa Nakshbandi and Wan Du},
  journal= {arXiv preprint arXiv:2601.18824},
  year   = {2026}
}