中文

具有概率触发臂的组合多臂老虎机:一种后悔有界的情形

机器学习 2017-07-25 v1 机器学习

摘要

在本文中,我们研究了具有概率触发臂(PTAs)的组合多臂老虎机问题(CMAB)。在所有臂的臂触发概率(ATPs)均为正的假设下,我们证明了一类上置信界(UCB)策略,即具有探索率 κ\kappa 的组合 UCB(CUCB-κ\kappa),以及通过 Thompson 采样估计臂的期望状态的组合 Thompson 采样(CTS),能够实现有界后悔。此外,我们证明 CUCB-00 和 CTS 产生 O(T)O(\sqrt{T}) 与间隙无关的后悔。这些结果改进了先前工作的结果,后者在未对 ATPs 作任何假设的情况下分别给出了 O(logT)O(\log T) 与间隙相关的后悔和 O(TlogT)O(\sqrt{T\log T}) 与间隙无关的后悔。然后,我们在真实世界的电影推荐问题中数值评估了 CUCB-κ\kappa 和 CTS 的性能,其中动作对应于推荐一组电影,臂对应于电影与用户之间的边,目标是最大化被至少一部电影吸引的用户总数。我们的数值结果补充了我们在有界后悔方面的理论发现。除该问题外,我们的结果也直接适用于许多先前工作中研究的在线影响力最大化(OIM)问题。

关键词

引用

@article{arxiv.1707.07443,
  title  = {Combinatorial Multi-armed Bandit with Probabilistically Triggered Arms: A Case with Bounded Regret},
  author = {A. Ömer Sarıtaç and Cem Tekin},
  journal= {arXiv preprint arXiv:1707.07443},
  year   = {2017}
}