具有方差自适应后悔界的三世界最优线性_bandit算法
机器学习
2023-02-27 v1 机器学习
摘要
本文提出一种在两层层级上均适应环境变化的线性bandit算法。在较高层,所提算法适应多种类型的环境。更确切地说,它实现了三世界最优(best-of-three-worlds)后悔界,即对于对抗环境为,对于带对抗污染的随机环境为,其中、和分别表示时间范围、最小次优间隙和污染总量。注意此处省略了维度上的多项式因子。在较低层,在对抗和随机两种机制各自中,所提算法适应特定环境特征,从而表现更优。所提算法具有数据依赖的后悔界,依赖于最优动作的全部累积损失、总二次变差以及损失向量序列的路径长度。此外,对于随机环境,所提算法还具有方差自适应后悔界,其中表示反馈损失的方差最大值。所提算法基于SCRiBLe算法。通过在其中融入一种称为放大采样(scaled-up sampling)的新技术,我们获得高层适应性;通过融入乐观在线学习技术,我们获得低层适应性。
引用
@article{arxiv.2302.12370,
title = {Best-of-Three-Worlds Linear Bandit Algorithm with Variance-Adaptive Regret Bounds},
author = {Shinji Ito and Kei Takemura},
journal= {arXiv preprint arXiv:2302.12370},
year = {2023}
}