中文

广义线性老虎机:单遍更新实现近乎最优的遗憾界

机器学习 2025-10-31 v2 机器学习

摘要

我们研究了广义线性老虎机(GLB)问题,这是一个上下文多臂老虎机框架,通过引入非线性链接函数扩展了经典线性模型,从而能够对一大类奖励分布(如伯努利分布和泊松分布)进行建模。尽管 GLB 广泛适用于现实场景,但其非线性特性在实现计算和统计双重高效方面引入了重大挑战。现有方法通常在两个目标之间进行权衡,要么为了最优遗憾保证而产生高昂的单轮计算成本,要么为了实现常数时间更新而妥协统计效率。在本文中,我们提出了一种联合高效的算法,该算法在每轮 O(1)\mathcal{O}(1) 的时间和空间复杂度下实现了近乎最优的遗憾界。我们方法的核心是用于在线镜像下降(OMD)估计器的紧置信集,该置信集是通过利用在线预测中混合损失的概念进行新颖分析推导得出的。分析表明,我们的 OMD 估计器即使采用单遍更新,也能实现与最大似然估计相当的统计效率,从而促成了一种联合高效的乐观方法。

关键词

引用

@article{arxiv.2507.11847,
  title  = {Generalized Linear Bandits: Almost Optimal Regret with One-Pass Update},
  author = {Yu-Jie Zhang and Sheng-An Xu and Peng Zhao and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2507.11847},
  year   = {2025}
}

备注

NeurIPS 2025