中文

无臂全序的组合赌博机

机器学习 2021-03-05 v1

摘要

我们考虑组合赌博机问题,其中在每时间步,在线学习器从臂集合 A\mathcal{A}A=n\left|\mathcal{A}\right| = n)中选择一个大小为 kk 的子集 ss,并观测所选集合 ss 中每个臂的随机奖励。在线学习器的目标是最小化因未选择使期望总奖励最大的 ss^* 而产生的后悔。具体而言,我们关注一个具有挑战性的设置:1)臂的奖励分布依赖于其所属集合 ss,且关键地 2)A\mathcal{A} 中的臂之间\textit{不存在全序}。本文中,我们正式提出一个捕获集合相关奖励分布且假设臂无全序的奖励模型。相应地,我们提出一种上置信界(UCB)算法,该算法维护每个单独臂的 UCB 并选择具有前 kk 大 UCB 的臂。我们开发了新颖的后悔分析,给出了 O(k2nlogTϵ)O\left(\frac{k^2 n \log T}{\epsilon}\right) 的间隙相关后悔界以及 O(k2nTlogT)O\left(k^2\sqrt{n T \log T}\right) 的间隙无关后悔界。我们还给出了所提奖励模型的下界,表明我们所提算法对任意常数 kk 是近最优的。在各种奖励模型上的实证结果显示了我们算法的广泛适用性。

关键词

引用

@article{arxiv.2103.02741,
  title  = {Combinatorial Bandits without Total Order for Arms},
  author = {Shuo Yang and Tongzheng Ren and Inderjit S. Dhillon and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:2103.02741},
  year   = {2021}
}