中文

具有方差自适应后悔界的三世界最优线性_bandit算法

机器学习 2023-02-27 v1 机器学习

摘要

本文提出一种在两层层级上均适应环境变化的线性bandit算法。在较高层,所提算法适应多种类型的环境。更确切地说,它实现了三世界最优(best-of-three-worlds)后悔界,即对于对抗环境为O(TlogT){O}(\sqrt{T \log T}),对于带对抗污染的随机环境为O(logTΔmin+ClogTΔmin)O(\frac{\log T}{\Delta_{\min}} + \sqrt{\frac{C \log T}{\Delta_{\min}}}),其中TTΔmin\Delta_{\min}CC分别表示时间范围、最小次优间隙和污染总量。注意此处省略了维度上的多项式因子。在较低层,在对抗和随机两种机制各自中,所提算法适应特定环境特征,从而表现更优。所提算法具有数据依赖的后悔界,依赖于最优动作的全部累积损失、总二次变差以及损失向量序列的路径长度。此外,对于随机环境,所提算法还具有方差自适应后悔界O(σ2logTΔmin)O(\frac{\sigma^2 \log T}{\Delta_{\min}}),其中σ2\sigma^2表示反馈损失的方差最大值。所提算法基于SCRiBLe算法。通过在其中融入一种称为放大采样(scaled-up sampling)的新技术,我们获得高层适应性;通过融入乐观在线学习技术,我们获得低层适应性。

关键词

引用

@article{arxiv.2302.12370,
  title  = {Best-of-Three-Worlds Linear Bandit Algorithm with Variance-Adaptive Regret Bounds},
  author = {Shinji Ito and Kei Takemura},
  journal= {arXiv preprint arXiv:2302.12370},
  year   = {2023}
}