聚集更庞大的bandit群:线性bandit切换遗憾案例研究
机器学习
2022-02-15 v1 机器学习
摘要
我们考虑组合并学习一组对抗性bandit算法的问题,目标是即时自适应地跟踪其中最优者。Agarwal 等人(2017)的 CORRAL 算法及其变体(Foster 等人,2020a)以 量级的遗憾开销实现了该目标,其中 M 为基础算法数量,T 为时间范围。然而,对 M 的多项式依赖阻碍了将这些算法应用于许多 M 为 poly 甚至更大的场景。受此问题驱动,我们提出一种新方案来聚集更庞大的 bandit 算法群,只要满足某些条件,其遗憾开销仅对数依赖于 M。作为主要示例,我们将该方案应用于 时 维 单位球上的对抗性线性bandit问题。通过聚集一大组 T 个基础算法(每个在不同时间步启动),我们的最终算法在与具有 S 次切换(对某已知 S)的比较序列竞争时,实现了首个最优切换遗憾 。我们进一步将结果扩展至光滑强凸域上的线性bandit以及无约束线性bandit。
引用
@article{arxiv.2202.06151,
title = {Corralling a Larger Band of Bandits: A Case Study on Switching Regret for Linear Bandits},
author = {Haipeng Luo and Mengxiao Zhang and Peng Zhao and Zhi-Hua Zhou},
journal= {arXiv preprint arXiv:2202.06151},
year = {2022}
}