中文

结合响应时间的偏好学习:鲁棒损失与保证

机器学习 2025-10-29 v2 人工智能 理论经济学 机器学习

摘要

本文研究将响应时间数据整合到人类偏好学习框架中,以实现更有效的奖励模型诱导。虽然二元偏好数据已成为微调基础模型、生成式AI系统及其他大规模模型的基础,但用户决策中固有的宝贵时间信息在很大程度上仍未被利用。我们提出了将响应时间信息与二元选择数据相结合的新方法,利用证据累积漂移扩散(EZ)模型,在该模型下响应时间能够反映偏好强度。我们开发了Neyman正交损失函数,实现了奖励模型学习的预言机收敛速率,匹配了在每个查询的期望响应时间先验已知时所能达到的理论最优速率。我们的理论分析表明,对于线性奖励函数,传统偏好学习的误差率随奖励幅度呈指数级增长。相比之下,我们结合响应时间的方法将其降低为多项式级增长,代表了样本效率的显著提升。我们将这些保证扩展到非参数奖励函数空间,为更复杂、更真实的奖励模型确立了收敛性质。我们的大量实验在图像偏好学习的背景下验证了理论发现。

关键词

引用

@article{arxiv.2505.22820,
  title  = {Preference Learning with Response Time: Robust Losses and Guarantees},
  author = {Ayush Sawarni and Sahasrajit Sarmasarkar and Vasilis Syrgkanis},
  journal= {arXiv preprint arXiv:2505.22820},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025