用单峰 Thompson 采样求解伯努利秩一_bandits
机器学习
2019-12-09 v1 机器学习
摘要
随机秩一 Bandits (Katarya 等人, 2017a,b) 是针对秩一臂矩阵上后悔最小化问题的简单框架。最初提出的算法被证明具有对数后悔,但与该问题的现有下界不匹配。我们通过首先证明秩一 bandits 是单峰 bandits 的特定实例,然后提供对 Paladino 等人 (2017) 最初提出的单峰 Thompson 采样 (UTS) 的新分析,弥补了这一差距。我们证明了 UTS 频率主义后悔的渐近最优后悔界,并通过仿真支持我们的主张,显示了我们的方法相较于最先进技术的显著改进。
引用
@article{arxiv.1912.03074,
title = {Solving Bernoulli Rank-One Bandits with Unimodal Thompson Sampling},
author = {Cindy Trinh and Emilie Kaufmann and Claire Vernade and Richard Combes},
journal= {arXiv preprint arXiv:1912.03074},
year = {2019}
}