基于自适应KL-UCB的多臂老虎机算法及其在马尔可夫与独立同分布设定下的应用
机器学习
2022-10-11 v4 机器学习
摘要
在多臂老虎机(MAB)问题的基于后悔(regret)表述中,除极少数情形外,大量文献聚焦于具有独立同分布(i.i.d.)奖励的臂。在本文中,我们考虑为奖励各自构成可能不属于单参数指数族的马尔可夫链的MAB问题获取后悔保证。在此类问题中取得对数后悔并不困难:标准Kullback-Leibler上置信界(KL-UCB)的一个变体即可胜任。然而,由此分析得到的常数较差,原因如下:i.i.d.奖励是马尔可夫奖励的特例,且难以设计一种无论底层模型确为马尔可夫还是i.i.d.都能良好工作的算法。为克服此问题,我们引入一种新颖算法,其利用基于全变距离(total variation distance)的检验来识别每个臂的奖励是确为马尔可夫还是i.i.d.。我们的算法随后在判定臂奖励为马尔可夫时,从使用标准KL-UCB切换到专用版KL-UCB,从而在对i.i.d.与马尔可夫设定下均取得低后悔。
引用
@article{arxiv.2009.06606,
title = {Adaptive KL-UCB based Bandit Algorithms for Markovian and i.i.d. Settings},
author = {Arghyadip Roy and Sanjay Shakkottai and R. Srikant},
journal= {arXiv preprint arXiv:2009.06606},
year = {2022}
}