中文

多臂老虎机的宽松后悔值

机器学习 2021-09-14 v4 机器学习

摘要

我们考虑多臂老虎机(MAB)问题,其中智能体依次选择动作并观测其所采取动作的奖励。虽然大多数算法试图最小化后悔值(regret),即最优动作奖励与智能体动作奖励的累积差值,但该准则可能导致不良结果。例如,在大规模问题中,或与环境的短暂交互下,找到最优臂不可行,而后悔值最小化算法往往过度探索。为克服此问题,此类设定下的算法应转而聚焦于选择近最优臂。为此,我们提出一种新的、更宽松的后悔值准则,其忽略小于某 ϵ\epsilon 的次优差距。随后,我们给出一种 Thompson Sampling (TS) 算法的变体,称为 ϵ\epsilon-TS,并证明其在宽松后悔值意义下的渐近最优性。重要的是,我们表明当最优臂的均值足够高时,ϵ\epsilon-TS 的宽松后悔值有常数上界。最后,我们展示了当智能体已知次优差距下界时,可应用 ϵ\epsilon-TS 来提升性能。

关键词

引用

@article{arxiv.2008.03959,
  title  = {Lenient Regret for Multi-Armed Bandits},
  author = {Nadav Merlis and Shie Mannor},
  journal= {arXiv preprint arXiv:2008.03959},
  year   = {2021}
}

备注

Accepted to AAAI2021