具有概率触发臂的组合多臂老虎机:一种后悔有界的情形
机器学习
2017-07-25 v1 机器学习
摘要
在本文中,我们研究了具有概率触发臂(PTAs)的组合多臂老虎机问题(CMAB)。在所有臂的臂触发概率(ATPs)均为正的假设下,我们证明了一类上置信界(UCB)策略,即具有探索率 的组合 UCB(CUCB-),以及通过 Thompson 采样估计臂的期望状态的组合 Thompson 采样(CTS),能够实现有界后悔。此外,我们证明 CUCB- 和 CTS 产生 与间隙无关的后悔。这些结果改进了先前工作的结果,后者在未对 ATPs 作任何假设的情况下分别给出了 与间隙相关的后悔和 与间隙无关的后悔。然后,我们在真实世界的电影推荐问题中数值评估了 CUCB- 和 CTS 的性能,其中动作对应于推荐一组电影,臂对应于电影与用户之间的边,目标是最大化被至少一部电影吸引的用户总数。我们的数值结果补充了我们在有界后悔方面的理论发现。除该问题外,我们的结果也直接适用于许多先前工作中研究的在线影响力最大化(OIM)问题。
引用
@article{arxiv.1707.07443,
title = {Combinatorial Multi-armed Bandit with Probabilistically Triggered Arms: A Case with Bounded Regret},
author = {A. Ömer Sarıtaç and Cem Tekin},
journal= {arXiv preprint arXiv:1707.07443},
year = {2017}
}