奖励漂移下多臂老虎机中的激励探索
机器学习
2019-12-17 v3 机器学习
摘要
我们研究了多臂老虎机(MAB)问题中的激励探索,其中玩家因探索贪心选择之外的臂而获得补偿,并可能对奖励提供有偏反馈。我们通过分析激励 MAB 算法的三种实例化(UCB、-Greedy 和 Thompson Sampling)的性能,试图理解这种漂移奖励反馈的影响。我们的结果表明,在漂移奖励下,它们均实现了 的遗憾与补偿,因此在激励探索方面是有效的。我们提供了数值示例以补充理论分析。
引用
@article{arxiv.1911.05142,
title = {Incentivized Exploration for Multi-Armed Bandits under Reward Drift},
author = {Zhiyuan Liu and Huazheng Wang and Fan Shen and Kai Liu and Lijun Chen},
journal= {arXiv preprint arXiv:1911.05142},
year = {2019}
}
备注
10 pages, 2 figures, AAAI 2020