中文

非平稳随机多臂老虎机:UCB 策略与极小极大遗憾

机器学习 2021-01-25 v1

摘要

我们研究非平稳随机多臂老虎机(MAB)问题,其中假设与各臂相关的奖励分布随时间变化,且期望奖励的总变化量受限于一个变化预算。策略的遗憾定义为使用该策略所获得的期望累积奖励与在每个时刻选择期望均值奖励最大之臂的预言机所获得的期望累积奖励之差。我们根据最坏情况遗憾(即满足变化预算的奖励分布序列集合上遗憾的上确界)来刻画所提策略的性能。我们通过三种不同方法——周期性重置、滑动观测窗口和折扣因子——扩展了基于上置信界(UCB)的策略,并证明它们相对于极小极大遗憾(即任何策略所能达到的最小最坏情况遗憾)是阶最优的。我们还放宽了奖励分布的亚高斯假设,开发了所提策略的鲁棒版本,能够处理重尾奖励分布并保持其性能保证。

关键词

引用

@article{arxiv.2101.08980,
  title  = {Nonstationary Stochastic Multiarmed Bandits: UCB Policies and Minimax Regret},
  author = {Lai Wei and Vaibhav Srivastava},
  journal= {arXiv preprint arXiv:2101.08980},
  year   = {2021}
}