Banker 在线镜像下降:延迟在线_bandit 学习的通用方法
机器学习
2023-05-30 v2
摘要
我们提出 Banker 在线镜像下降(Banker Online Mirror Descent, Banker-OMD),一种推广在线学习文献中经典在线镜像下降(Online Mirror Descent, OMD)技术的新框架。Banker-OMD 框架几乎完全解耦了反馈延迟处理与任务特定的 OMD 算法设计,从而便于设计能够高效且鲁棒地处理反馈延迟的新算法。具体而言,它提供了一种在带延迟反馈的在线 bandit 学习任务中实现 风格后悔界的一般方法,其中 为轮数, 为总反馈延迟。我们通过应用于两个重要的带延迟反馈 bandit 学习场景来展示 \texttt{Banker-OMD} 的能力,包括延迟无尺度对抗多臂_bandit(Multi-Armed Bandits, MAB)和延迟对抗线性 bandit。\texttt{Banker-OMD} 导出了首个达到 后悔的延迟无尺度对抗 MAB 算法,以及首个达到 后悔的延迟对抗线性 bandit 算法。作为推论,首个应用也意味着非延迟无尺度对抗 MAB 的 后悔,这是首个在对数因子内匹配 下界的算法,且可独立引人关注。
引用
@article{arxiv.2301.10500,
title = {Banker Online Mirror Descent: A Universal Approach for Delayed Online Bandit Learning},
author = {Jiatai Huang and Yan Dai and Longbo Huang},
journal= {arXiv preprint arXiv:2301.10500},
year = {2023}
}
备注
Based on preliminary works arXiv:2106.08943 and arXiv:2110.13400; Accepted by ICML2023