通用对决_bandits:基于偏好在线学习的最优双世界分析
机器学习
2022-02-15 v1 机器学习
摘要
我们研究 -臂对决 bandit 在随机与对抗两种环境下的的问题,其中学习者的目标是通过以在线顺序方式查询的决策点对之间的相对偏好来聚合信息。我们首先提出一种从任意(通用)对决 bandits 到多臂 bandits 的新归约,尽管简单,它使我们能够改进对决 bandits 中的许多现有结果。特别地,\emph{我们给出了对决 bandits 遗憾最小化问题的首个最优双世界结果}——一个统一框架,保证同时对随机与对抗偏好都达到最优性能。此外,我们的算法也是首个针对 Condorcet 胜者基准实现最优 遗憾界的算法,该界在臂数 与实例相关次优间隙 上均最优缩放。这解决了为对决 bandits 设计实例相关间隙依赖阶最优遗憾算法(匹配下界至小常数因子)的长期问题。我们通过证明所提算法在对抗损坏偏好下的优化遗憾率进一步佐证了其鲁棒性——这大幅优于现有的最先进损坏对决结果。总之,我们相信我们的归约思想将在解决多样化对决 bandits 设定中找到更广的适用范围,否则这些设定常与多臂 bandits 分开研究且常有更复杂的解与更差的保证。我们提出算法的功效通过针对现有对决 bandit 方法的实证得到了证实。
引用
@article{arxiv.2202.06694,
title = {Versatile Dueling Bandits: Best-of-both-World Analyses for Online Learning from Preferences},
author = {Aadirupa Saha and Pierre Gaillard},
journal= {arXiv preprint arXiv:2202.06694},
year = {2022}
}