中文

折扣型在线镜像梯度下的非平稳广义线性多臂老虎机

机器学习 2026-05-26 v1 机器学习

摘要

我们研究非平稳广义线性多臂老虎机(GLBs),其中预期奖励通过具有未知时变参数的非线性链接函数建模。该框架涵盖了包括线性、伯努利和二项式奖励在内的广泛奖励模型。现有方法主要基于最大似然估计(MLE),使用滑动窗口、重启或折扣机制来处理非平稳性。虽然这些方法实现了统计上高效的 regret 保证,但通常需要在每个回合都回访过去的观察,这导致随时间增长的计算和内存开销;此外,一些方法依赖非凸投影步骤。在本文中,我们提出了 DOMD-GLB,一种用于非平稳 GLBs 的新算法,利用折扣型在线镜像梯度(DOMD)进行参数估计,从而在每个回合仅产生 O(1)O(1) 的计算和内存开销。我们证明了在漂移环境中动态 regret 上限为 O~(cμ1/2d3/4PT1/4T3/4)\tilde{O} \big(c_\mu^{-1/2} d^{3/4} P_T^{1/4} T^{3/4}\big),在分段平稳环境中为 O~(cμ1/3d2/3ΓT1/3T2/3)\tilde{O}\big(c_\mu^{-1/3} d^{2/3} \Gamma_T^{1/3} T^{2/3}\big),其中 dd 表示特征维数,TT 表示时间范围,PTP_T 表示路径长度,ΓT\Gamma_T 表示变化点数,cμc_\mu 表示与链接函数相关的曲率参数,而在已有工作之上显著提高了计算效率。据我们了解,这是第一个在每个回合计算和内存开销独立于时间的非平稳 GLBs 算法。

关键词

引用

@article{arxiv.2605.25590,
  title  = {Nonstationary Generalized Linear Bandits with Discounted Online Mirror Descent},
  author = {Joongkyu Lee and Min-hwan Oh},
  journal= {arXiv preprint arXiv:2605.25590},
  year   = {2026}
}