折扣型在线镜像梯度下的非平稳广义线性多臂老虎机
机器学习
2026-05-26 v1 机器学习
摘要
我们研究非平稳广义线性多臂老虎机(GLBs),其中预期奖励通过具有未知时变参数的非线性链接函数建模。该框架涵盖了包括线性、伯努利和二项式奖励在内的广泛奖励模型。现有方法主要基于最大似然估计(MLE),使用滑动窗口、重启或折扣机制来处理非平稳性。虽然这些方法实现了统计上高效的 regret 保证,但通常需要在每个回合都回访过去的观察,这导致随时间增长的计算和内存开销;此外,一些方法依赖非凸投影步骤。在本文中,我们提出了 DOMD-GLB,一种用于非平稳 GLBs 的新算法,利用折扣型在线镜像梯度(DOMD)进行参数估计,从而在每个回合仅产生 的计算和内存开销。我们证明了在漂移环境中动态 regret 上限为 ,在分段平稳环境中为 ,其中 表示特征维数, 表示时间范围, 表示路径长度, 表示变化点数, 表示与链接函数相关的曲率参数,而在已有工作之上显著提高了计算效率。据我们了解,这是第一个在每个回合计算和内存开销独立于时间的非平稳 GLBs 算法。
引用
@article{arxiv.2605.25590,
title = {Nonstationary Generalized Linear Bandits with Discounted Online Mirror Descent},
author = {Joongkyu Lee and Min-hwan Oh},
journal= {arXiv preprint arXiv:2605.25590},
year = {2026}
}