中文

具有休眠臂与长期公平性约束的组合半赌博机中的汤普森采样

机器学习 2020-05-15 v1 机器学习

摘要

我们研究具有长期公平性约束的组合休眠多臂半赌博机问题(CSMAB-F)。为解决该问题,我们采用汤普森采样(TS)来最大化总奖励,并使用虚拟队列技术处理公平性约束,设计了一种称为“用于 CSMAB-F 的带 beta 先验与伯努利似然的 TS(TSCSF-B)”的算法。进一步,我们证明 TSCSF-B 能满足公平性约束,且时间平均后悔的上界为 N2η+O(mNTlnTT)\frac{N}{2\eta} + O\left(\frac{\sqrt{mNT\ln T}}{T}\right),其中 NN 为臂的总数,mm 为每轮可同时拉动的最大臂数(基数约束),η\eta 为在公平与奖励间权衡的参数。通过放宽公平性约束(即令 η\eta \rightarrow \infty),该界退化为组合休眠多臂半赌博机问题下 TS 算法的首个与问题无关的界。最后,我们进行数值实验并采用高评分电影推荐应用来展示所提算法的有效性与高效性。

关键词

引用

@article{arxiv.2005.06725,
  title  = {Thompson Sampling for Combinatorial Semi-bandits with Sleeping Arms and Long-Term Fairness Constraints},
  author = {Zhiming Huang and Yifan Xu and Bingshan Hu and Qipeng Wang and Jianping Pan},
  journal= {arXiv preprint arXiv:2005.06725},
  year   = {2020}
}