具有全_bandit反馈的Top-k组合_bandit问题
机器学习
2019-12-05 v2 机器学习
摘要
Top-k组合_bandit推广了多臂_bandit,其中每轮可从n个臂中选取任意k个臂的子集,并获得奖励之和。我们处理全_bandit反馈,即智能体仅观测奖励之和,这与半_bandit反馈相反,后者中智能体还观测各个臂的奖励。我们提出组合逐次接受与拒绝(CSAR)算法,将SAR(Bubeck等人,2013)推广至top-k组合_bandit。我们的主要贡献是一种高效的采样方案,利用Hadamard矩阵来准确估计各个臂的期望奖励。我们讨论了该算法的两种变体,第一种最小化样本复杂度,第二种最小化后悔值。我们还证明了样本复杂度的下界,该下界对是紧的。最后,我们进行了实验并表明我们的算法优于其他方法。
引用
@article{arxiv.1905.12624,
title = {Top-k Combinatorial Bandits with Full-Bandit Feedback},
author = {Idan Rejwan and Yishay Mansour},
journal= {arXiv preprint arXiv:1905.12624},
year = {2019}
}