中文

奖励漂移下多臂老虎机中的激励探索

机器学习 2019-12-17 v3 机器学习

摘要

我们研究了多臂老虎机(MAB)问题中的激励探索,其中玩家因探索贪心选择之外的臂而获得补偿,并可能对奖励提供有偏反馈。我们通过分析激励 MAB 算法的三种实例化(UCB、ε\varepsilon-Greedy 和 Thompson Sampling)的性能,试图理解这种漂移奖励反馈的影响。我们的结果表明,在漂移奖励下,它们均实现了 O(logT)\mathcal{O}(\log T) 的遗憾与补偿,因此在激励探索方面是有效的。我们提供了数值示例以补充理论分析。

关键词

引用

@article{arxiv.1911.05142,
  title  = {Incentivized Exploration for Multi-Armed Bandits under Reward Drift},
  author = {Zhiyuan Liu and Huazheng Wang and Fan Shen and Kai Liu and Lijun Chen},
  journal= {arXiv preprint arXiv:1911.05142},
  year   = {2019}
}

备注

10 pages, 2 figures, AAAI 2020