中文

睡眠赌博机中近最优的每动作遗憾界

机器学习 2024-05-31 v2 机器学习

摘要

我们推导了睡眠赌博机中近最优的每动作遗憾界,其中每轮可用臂的集合及其损失均由对手选择。在总臂数为KK、每轮最多有AA个可用臂、共TT轮的设置中,已知的最佳上界为O(KTAlnK)O(K\sqrt{TA\ln{K}}),这是通过间接最小化内部睡眠遗憾得到的。与极小极大下界Ω(TA)\Omega(\sqrt{TA})相比,该上界包含一个额外的乘性因子KlnKK\ln{K}。我们通过直接使用EXP3、EXP3-IX和带Tsallis熵的FTRL的广义版本来最小化每动作遗憾,从而解决了这一差距,得到了O(TAlnK)O(\sqrt{TA\ln{K}})O(TAK)O(\sqrt{T\sqrt{AK}})量级的近最优界。我们将结果扩展到具有睡眠专家建议的赌博机设置,并在此过程中推广了EXP4。这为标准非睡眠赌博机的许多现有自适应和跟踪遗憾界提供了新的证明。将我们的结果扩展到报告其置信度的专家的赌博机版本,为置信遗憾提供了新的界,该界主要依赖于专家置信度之和。我们证明了一个下界,表明对于任何极小极大最优算法,都存在一个动作,其遗憾在TT上是次线性的,但在其活跃轮数上是线性的。

关键词

引用

@article{arxiv.2403.01315,
  title  = {Near-optimal Per-Action Regret Bounds for Sleeping Bandits},
  author = {Quan Nguyen and Nishant A. Mehta},
  journal= {arXiv preprint arXiv:2403.01315},
  year   = {2024}
}

备注

V2: corrected Theorem 8 (FTARL's high probability bound) from log(1/delta) to log(K/delta)