中文

面向线性约束多臂赌博机的 Thompson 采样

机器学习 2020-05-14 v2 机器学习

摘要

我们研究多臂赌博机(MAB),其目标是在概率性线性约束下最大化累积奖励。针对该问题的若干真实世界实例,近来提出了著名 Thompson 采样(TS)启发式的约束扩展。然而,约束 TS 的有限时间分析颇具挑战;结果仅能得到累积奖励损失(即后悔值)的 O(\sqrt{T}) 界。本文中,我们描述 LinConTS,一种基于 TS、针对每轮奖励概率受线性约束的赌博机算法。我们证明,对 LinConTS 而言,次优臂的后悔值与累积约束违反均被 O(\log T) 从上界所限。我们发展了依赖对偶问题细致分析的证明技巧,并将其与近期无约束 TS 的理论工作相结合。通过在两个真实世界数据集上的数值实验,我们证明 LinConTS 在同时最小化后悔值与违反方面优于渐近最优的上置信界(UCB)方案。

关键词

引用

@article{arxiv.2004.09258,
  title  = {Thompson Sampling for Linearly Constrained Bandits},
  author = {Vidit Saxena and Joseph E. Gonzalez and Joakim Jaldén},
  journal= {arXiv preprint arXiv:2004.09258},
  year   = {2020}
}

备注

10 pages, 2 figures, updated version of paper accepted at AISTATS2020