信息鸿沟下线性_bandit_中激励探索问题研究
机器学习
2021-04-09 v1
摘要
我们研究线性 bandit 中激励短视用户探索的问题,其中用户倾向于利用预测奖励最高的臂而非进行探索。为了最大化长期奖励,系统提供补偿以激励用户拉动探索性臂,目标是在利用、探索和补偿之间平衡权衡。我们考虑一种新颖且受实际启发的设定,即用户观察到的上下文特征比系统使用的更具信息性,例如基于用户私人信息的特征系统无法获取。我们提出一种在此种信息鸿沟下激励探索的新方法,并证明该方法实现了次线性后悔(regret)和次线性补偿。我们从理论上和实证上分析了相较于系统可访问与用户相同上下文特征(即无信息鸿沟)的情况,由信息鸿沟所带来的额外补偿。我们还给出了该问题的补偿下界。
引用
@article{arxiv.2104.03860,
title = {Incentivizing Exploration in Linear Bandits under Information Gap},
author = {Huazheng Wang and Haifeng Xu and Chuanhao Li and Zhiyuan Liu and Hongning Wang},
journal= {arXiv preprint arXiv:2104.03860},
year = {2021}
}