具有有限自适应性的广义线性 Bandit
机器学习
2025-10-29 v5 机器学习
摘要
我们研究有限自适应性约束下的广义线性上下文 bandit 问题。在本文中,我们提出了两种算法 和 ,分别解决两种普遍存在的有限自适应性设置。给定策略更新次数的预算 ,在第一种设置中,算法需要预先决定将要更新策略的 轮,而在第二种设置中,它可以在其运行过程中自适应地执行 次策略更新。对于第一种设置,我们设计了一种算法 ,当 且臂特征向量随机生成时,该算法产生 的遗憾。对于第二种设置,我们设计了一种算法 ,它更新其策略 次,即使臂特征向量是对抗性生成的,也能实现 的遗憾。值得注意的是,在这些界限中,我们成功消除了对关键实例相关参数 的依赖,该参数捕获了底层奖励模型的非线性。我们消除广义线性上下文 bandit 中这种依赖性的新方法可能具有独立的研究价值。
引用
@article{arxiv.2404.06831,
title = {Generalized Linear Bandits with Limited Adaptivity},
author = {Ayush Sawarni and Nirjhar Das and Siddharth Barman and Gaurav Sinha},
journal= {arXiv preprint arXiv:2404.06831},
year = {2025}
}
备注
Accepted as Spotlight to NeurIPS 2024