中文

聚集更庞大的bandit群:线性bandit切换遗憾案例研究

机器学习 2022-02-15 v1 机器学习

摘要

我们考虑组合并学习一组对抗性bandit算法的问题,目标是即时自适应地跟踪其中最优者。Agarwal 等人(2017)的 CORRAL 算法及其变体(Foster 等人,2020a)以 O~(MT)\widetilde{O}(\sqrt{MT}) 量级的遗憾开销实现了该目标,其中 M 为基础算法数量,T 为时间范围。然而,对 M 的多项式依赖阻碍了将这些算法应用于许多 M 为 poly(T)(T) 甚至更大的场景。受此问题驱动,我们提出一种新方案来聚集更庞大的 bandit 算法群,只要满足某些条件,其遗憾开销仅对数依赖于 M。作为主要示例,我们将该方案应用于 p(1,2]p \in (1,2]ddp\ell_p 单位球上的对抗性线性bandit问题。通过聚集一大组 T 个基础算法(每个在不同时间步启动),我们的最终算法在与具有 S 次切换(对某已知 S)的比较序列竞争时,实现了首个最优切换遗憾 O~(dST)\widetilde{O}(\sqrt{d S T})。我们进一步将结果扩展至光滑强凸域上的线性bandit以及无约束线性bandit。

关键词

引用

@article{arxiv.2202.06151,
  title  = {Corralling a Larger Band of Bandits: A Case Study on Switching Regret for Linear Bandits},
  author = {Haipeng Luo and Mengxiao Zhang and Peng Zhao and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:2202.06151},
  year   = {2022}
}