中文

Banker 在线镜像下降:延迟在线_bandit 学习的通用方法

机器学习 2023-05-30 v2

摘要

我们提出 Banker 在线镜像下降(Banker Online Mirror Descent, Banker-OMD),一种推广在线学习文献中经典在线镜像下降(Online Mirror Descent, OMD)技术的新框架。Banker-OMD 框架几乎完全解耦了反馈延迟处理与任务特定的 OMD 算法设计,从而便于设计能够高效且鲁棒地处理反馈延迟的新算法。具体而言,它提供了一种在带延迟反馈的在线 bandit 学习任务中实现 O~(T+D)\widetilde{\mathcal O}(\sqrt{T} + \sqrt{D}) 风格后悔界的一般方法,其中 TT 为轮数,DD 为总反馈延迟。我们通过应用于两个重要的带延迟反馈 bandit 学习场景来展示 \texttt{Banker-OMD} 的能力,包括延迟无尺度对抗多臂_bandit(Multi-Armed Bandits, MAB)和延迟对抗线性 bandit。\texttt{Banker-OMD} 导出了首个达到 O~(KL(T+D))\widetilde{\mathcal O}(\sqrt{K}L(\sqrt T+\sqrt D)) 后悔的延迟无尺度对抗 MAB 算法,以及首个达到 O~(poly(n)(T+D))\widetilde{\mathcal O}(\text{poly}(n)(\sqrt{T} + \sqrt{D})) 后悔的延迟对抗线性 bandit 算法。作为推论,首个应用也意味着非延迟无尺度对抗 MAB 的 O~(KTL)\widetilde{\mathcal O}(\sqrt{KT}L) 后悔,这是首个在对数因子内匹配 Ω(KTL)\Omega(\sqrt{KT}L) 下界的算法,且可独立引人关注。

关键词

引用

@article{arxiv.2301.10500,
  title  = {Banker Online Mirror Descent: A Universal Approach for Delayed Online Bandit Learning},
  author = {Jiatai Huang and Yan Dai and Longbo Huang},
  journal= {arXiv preprint arXiv:2301.10500},
  year   = {2023}
}

备注

Based on preliminary works arXiv:2106.08943 and arXiv:2110.13400; Accepted by ICML2023