中文

基于自适应KL-UCB的多臂老虎机算法及其在马尔可夫与独立同分布设定下的应用

机器学习 2022-10-11 v4 机器学习

摘要

在多臂老虎机(MAB)问题的基于后悔(regret)表述中,除极少数情形外,大量文献聚焦于具有独立同分布(i.i.d.)奖励的臂。在本文中,我们考虑为奖励各自构成可能不属于单参数指数族的马尔可夫链的MAB问题获取后悔保证。在此类问题中取得对数后悔并不困难:标准Kullback-Leibler上置信界(KL-UCB)的一个变体即可胜任。然而,由此分析得到的常数较差,原因如下:i.i.d.奖励是马尔可夫奖励的特例,且难以设计一种无论底层模型确为马尔可夫还是i.i.d.都能良好工作的算法。为克服此问题,我们引入一种新颖算法,其利用基于全变距离(total variation distance)的检验来识别每个臂的奖励是确为马尔可夫还是i.i.d.。我们的算法随后在判定臂奖励为马尔可夫时,从使用标准KL-UCB切换到专用版KL-UCB,从而在对i.i.d.与马尔可夫设定下均取得低后悔。

关键词

引用

@article{arxiv.2009.06606,
  title  = {Adaptive KL-UCB based Bandit Algorithms for Markovian and i.i.d. Settings},
  author = {Arghyadip Roy and Sanjay Shakkottai and R. Srikant},
  journal= {arXiv preprint arXiv:2009.06606},
  year   = {2022}
}