通过人类响应时间增强基于偏好的线性赌博机
机器学习
2025-01-03 v4 人工智能
人机交互
计量经济学
机器学习
摘要
交互式偏好学习系统通过将查询呈现为选项对并收集二元选择来推断人类偏好。尽管二元选择简单且广泛使用,但它们提供的关于偏好强度的信息有限。为了解决这个问题,我们利用与偏好强度成反比的人类响应时间作为额外信号。我们提出了一种计算高效的方法,该方法结合选择和响应时间来估计人类效用函数,其理论基础是心理学中的 EZ 扩散模型。理论和实证分析表明,对于具有强烈偏好的查询,响应时间通过提供关于偏好强度的额外信息来补充选择,从而显著改善效用估计。我们将此估计器整合到用于固定预算最佳臂识别的基于偏好的线性赌博机中。在三个真实世界数据集上的模拟表明,与仅使用选择的方法相比,使用响应时间显著加速了偏好学习。更多材料,如代码、幻灯片和演讲视频,可在 https://shenlirobot.github.io/pages/NeurIPS24.html 获取。
引用
@article{arxiv.2409.05798,
title = {Enhancing Preference-based Linear Bandits via Human Response Time},
author = {Shen Li and Yuyang Zhang and Zhaolin Ren and Claire Liang and Na Li and Julie A. Shah},
journal= {arXiv preprint arXiv:2409.05798},
year = {2025}
}
备注
NeurIPS 2024 (Oral) camera ready