Tsallis-INF:一种用于随机与对抗多臂老虎机的优化算法
机器学习
2022-03-03 v6 机器学习
摘要
我们推导出一种算法,该算法在无需事先知晓机制与时间范围的情况下,于对抗与随机多臂老虎机中均达到最优(常数范围内)的伪遗憾。该算法基于在线镜像下降(OMD),采用幂次 的 Tsallis 熵正则化以及降方差损失估计量。更一般地,我们定义了一种带自界约束的对抗机制,其包含随机机制、随机约束对抗机制(Wei and Luo)以及带对抗污染的随机机制(Lykouris et al.)作为特例,并表明该算法在此机制及其所有特例中同时实现对数遗憾保证与对抗遗憾保证。该算法在基于效用的对决老虎机设定中也达到对抗与随机最优性。我们对该算法进行了实证评估,表明其在随机环境中显著优于 UCB1 与 EXP3。我们还提供了对抗环境的例子,其中 UCB1 与 Thompson Sampling 表现出近乎线性的遗憾,而我们的算法仅遭受对数遗憾。据我们所知,这是首个展示 Thompson Sampling 在对抗环境中脆弱性的例子。最后但同样重要的是,我们给出了对 的 Tsallis 熵正则化 OMD 算法的通用随机分析与通用对抗分析,并解释了为何 效果最佳。
引用
@article{arxiv.1807.07623,
title = {Tsallis-INF: An Optimal Algorithm for Stochastic and Adversarial Bandits},
author = {Julian Zimmert and Yevgeny Seldin},
journal= {arXiv preprint arXiv:1807.07623},
year = {2022}
}