中文

关于缓慢变化的非平稳多臂老虎机

机器学习 2021-10-26 v1 机器学习

摘要

我们考虑具有缓慢变化特性的非平稳多臂老虎机中动态后悔的最小化问题。具体而言,我们假设各臂奖励随时间随机且独立,但任意臂在任意两个相邻时间步上的期望奖励绝对差不超过漂移上限 δ>0\delta > 0。针对这一过去未受足够重视的设置,我们给出一种新算法,将著名的连续消去(Successive Elimination)算法自然拓展至非平稳多臂老虎机设置。我们建立了缓慢变化非平稳多臂老虎机的首个依赖于具体实例的后悔上界。该分析转而依赖于以可检测间隙剖面对该实例的新表征,其取决于各臂期望奖励差。我们还给出了该问题的首个极小极大后悔下界,从而表明我们的算法本质上是极小极大最优的。此外,我们所获得的下界与更一般的全变差预算多臂老虎机问题之下界相符,确立了在极小极大意义下看似更易的前者问题至少与更一般的后者问题同样困难。我们以实验说明补充了理论结果。

关键词

引用

@article{arxiv.2110.12916,
  title  = {On Slowly-varying Non-stationary Bandits},
  author = {Ramakrishnan Krishnamurthy and Aditya Gopalan},
  journal= {arXiv preprint arXiv:2110.12916},
  year   = {2021}
}

备注

Under submission