中文

多臂老虎机中的查询-奖励权衡

机器学习 2022-10-28 v2

摘要

我们考虑一种随机多臂老虎机设定,其中必须主动查询奖励才能观测到它。我们对后悔值和查询次数均给出了紧致的问题相关下界与上界保证。有趣的是,我们证明了与标准多臂老虎机问题不同,在具有唯一最优臂与多个最优臂的问题之间存在根本差异。我们还提出了一种新颖、简单的类 UCB 采样概念,并表明它能自然适应最优臂的数量,并实现紧致的后悔值与查询界限。

关键词

引用

@article{arxiv.2110.05724,
  title  = {Query-Reward Tradeoffs in Multi-Armed Bandits},
  author = {Nadav Merlis and Yonathan Efroni and Shie Mannor},
  journal= {arXiv preprint arXiv:2110.05724},
  year   = {2022}
}