一箭双雕:实现休眠老虎机最优遗憾保证的统一框架
机器学习
2022-10-28 v1
摘要
我们解决了完全对抗性设置下休眠老虎机(Sleeping Bandits)中的“内部遗憾”(Internal Regret)问题,并建立了多臂老虎机(MAB)文献中不同现有休眠遗憾概念之间的联系,进而分析了其含义:我们的第一个贡献是为休眠MAB提出了“内部遗憾”的新概念。然后,我们提出了一种算法,即使对于完全对抗性的损失和可用性序列,也能在该度量上产生次线性遗憾。我们进一步证明,低的休眠内部遗憾总是意味着低的外部遗憾,并且对于独立同分布的损失序列也意味着低的策略遗憾。本工作的主要贡献恰恰在于统一了休眠老虎机中现有的不同遗憾概念,并理解它们之间的相互影响。最后,我们还将结果扩展到“决斗老虎机”(Dueling Bandits, DB)——一种MAB的偏好反馈变体——的设置,并提出了一种归约到MAB的思想,为具有随机偏好和对抗性可用性的休眠决斗老虎机设计了一种低遗憾算法。我们通过实证评估验证了算法的有效性。
引用
@article{arxiv.2210.14998,
title = {One Arrow, Two Kills: An Unified Framework for Achieving Optimal Regret Guarantees in Sleeping Bandits},
author = {Pierre Gaillard and Aadirupa Saha and Soham Dan},
journal= {arXiv preprint arXiv:2210.14998},
year = {2022}
}