具有对抗性损坏的线性上下文赌博机
机器学习
2021-10-26 v1 机器学习
摘要
我们研究在存在对抗性损坏情况下的线性上下文赌博机问题,其中玩家与可能无限决策集之间的交互被对手污染,该对手可损坏奖励,损坏水平 由每轮奖励上最大改动之和度量。我们提出一种能自适应于对抗污染水平 的方差感知算法。关键算法设计包括 (1) 观测数据的多级划分方案,(2) 自适应于损坏水平的级联置信集,以及 (3) 可利用低方差奖励的方差感知置信集构造。我们进一步证明所提算法的后悔界为 ,其中 为上下文向量维度, 为轮数, 为噪声范围, 为瞬时奖励的方差。我们还证明了所提算法的间隙依赖后悔界,其为实例依赖的,从而在良好的实际实例上带来更优性能。据我们所知,这是首个针对上下文赌博机的方差感知抗损坏鲁棒算法。在合成数据上的实验证实了我们的理论。
引用
@article{arxiv.2110.12615,
title = {Linear Contextual Bandits with Adversarial Corruptions},
author = {Heyang Zhao and Dongruo Zhou and Quanquan Gu},
journal= {arXiv preprint arXiv:2110.12615},
year = {2021}
}
备注
27 pages, 1 figure