在参数化 Bandit 中利用相关的辅助反馈
机器学习
2023-11-07 v1 机器学习
摘要
我们研究了一类新颖的参数化 bandit 问题变体,其中学习者可以观察到与所观测奖励相关的额外辅助反馈。辅助反馈在许多现实应用中 readily available,例如,一个想要向用户推荐评分最高服务的在线平台可以观察用户对服务的评分(奖励)并收集额外信息如服务交付时间(辅助反馈)。在本文中,我们首先开发了一种利用辅助反馈来构建具有紧置信界的奖励估计器的方法,从而导致更小的后悔值。然后我们根据奖励与其辅助反馈之间的相关系数刻画了后悔值的减少。不同设定下的实验结果也验证了我们所提方法取得的性能提升。
引用
@article{arxiv.2311.02715,
title = {Exploiting Correlated Auxiliary Feedback in Parameterized Bandits},
author = {Arun Verma and Zhongxiang Dai and Yao Shu and Bryan Kian Hsiang Low},
journal= {arXiv preprint arXiv:2311.02715},
year = {2023}
}
备注
Accepted to NeurIPS 2023