中文

响应时间增强与异质偏好的对齐

机器学习 2026-05-11 v1 计算机科学与博弈论 理论经济学 机器学习

摘要

将大型语言模型(LLM)对齐至人类偏好通常依赖于将汇总的反馈聚合到单一奖励模型中。然而,这种标准方法假设所有标注者共享相同的底层偏好,忽略了现实中的标注者高度异质且通常匿名这一事实。因此,仅依赖二元选择数据会从根本上扭曲所学策略,使得真实的总体平均偏好无法被识别。为克服这一关键局限,我们证明,通过在偏好数据集中增加一个简单的次级信号——用户的响应时间——即可恢复总体平均偏好的可识别性。通过将每次决策建模为漂移扩散模型(DDM),我们引入了一种新颖且一致的异质偏好估计器,成功纠正了仅基于标准选择标签的扭曲。我们证明,即使在每个匿名标注者仅贡献单次选择的极端情况下,我们的估计器仍渐近收敛于真实的平均偏好。在合成数据集与真实世界数据集上的实验表明,我们的方法持续优于那些失效并停滞于偏差下限的标准基线。由于响应时间几乎可以零成本记录,且无需任何用户跟踪或身份识别,我们的结果带来了希望,并为未来的数据收集流程在不要求用户级标识符或重复启发的情况下提升社会效益开辟了新机遇。

关键词

引用

@article{arxiv.2605.06987,
  title  = {Response Time Enhances Alignment with Heterogeneous Preferences},
  author = {Federico Echenique and Alireza Fallah and Baihe Huang and Michael I. Jordan},
  journal= {arXiv preprint arXiv:2605.06987},
  year   = {2026}
}