多臂老虎机中的查询-奖励权衡
机器学习
2022-10-28 v2
摘要
我们考虑一种随机多臂老虎机设定,其中必须主动查询奖励才能观测到它。我们对后悔值和查询次数均给出了紧致的问题相关下界与上界保证。有趣的是,我们证明了与标准多臂老虎机问题不同,在具有唯一最优臂与多个最优臂的问题之间存在根本差异。我们还提出了一种新颖、简单的类 UCB 采样概念,并表明它能自然适应最优臂的数量,并实现紧致的后悔值与查询界限。
引用
@article{arxiv.2110.05724,
title = {Query-Reward Tradeoffs in Multi-Armed Bandits},
author = {Nadav Merlis and Yonathan Efroni and Shie Mannor},
journal= {arXiv preprint arXiv:2110.05724},
year = {2022}
}