中文

具有有限自适应性的广义线性 Bandit

机器学习 2025-10-29 v5 机器学习

摘要

我们研究有限自适应性约束下的广义线性上下文 bandit 问题。在本文中,我们提出了两种算法 B-GLinCB\texttt{B-GLinCB}RS-GLinCB\texttt{RS-GLinCB},分别解决两种普遍存在的有限自适应性设置。给定策略更新次数的预算 MM,在第一种设置中,算法需要预先决定将要更新策略的 MM 轮,而在第二种设置中,它可以在其运行过程中自适应地执行 MM 次策略更新。对于第一种设置,我们设计了一种算法 B-GLinCB\texttt{B-GLinCB},当 M=Ω(loglogT)M = \Omega( \log{\log T} ) 且臂特征向量随机生成时,该算法产生 O~(T)\tilde{O}(\sqrt{T}) 的遗憾。对于第二种设置,我们设计了一种算法 RS-GLinCB\texttt{RS-GLinCB},它更新其策略 O~(log2T)\tilde{O}(\log^2 T) 次,即使臂特征向量是对抗性生成的,也能实现 O~(T)\tilde{O}(\sqrt{T}) 的遗憾。值得注意的是,在这些界限中,我们成功消除了对关键实例相关参数 κ\kappa 的依赖,该参数捕获了底层奖励模型的非线性。我们消除广义线性上下文 bandit 中这种依赖性的新方法可能具有独立的研究价值。

关键词

引用

@article{arxiv.2404.06831,
  title  = {Generalized Linear Bandits with Limited Adaptivity},
  author = {Ayush Sawarni and Nirjhar Das and Siddharth Barman and Gaurav Sinha},
  journal= {arXiv preprint arXiv:2404.06831},
  year   = {2025}
}

备注

Accepted as Spotlight to NeurIPS 2024