中文

具有全_bandit反馈的Top-k组合_bandit问题

机器学习 2019-12-05 v2 机器学习

摘要

Top-k组合_bandit推广了多臂_bandit,其中每轮可从n个臂中选取任意k个臂的子集,并获得奖励之和。我们处理全_bandit反馈,即智能体仅观测奖励之和,这与半_bandit反馈相反,后者中智能体还观测各个臂的奖励。我们提出组合逐次接受与拒绝(CSAR)算法,将SAR(Bubeck等人,2013)推广至top-k组合_bandit。我们的主要贡献是一种高效的采样方案,利用Hadamard矩阵来准确估计各个臂的期望奖励。我们讨论了该算法的两种变体,第一种最小化样本复杂度,第二种最小化后悔值。我们还证明了样本复杂度的下界,该下界对k=O(1)k=O(1)是紧的。最后,我们进行了实验并表明我们的算法优于其他方法。

关键词

引用

@article{arxiv.1905.12624,
  title  = {Top-k Combinatorial Bandits with Full-Bandit Feedback},
  author = {Idan Rejwan and Yishay Mansour},
  journal= {arXiv preprint arXiv:1905.12624},
  year   = {2019}
}