中文

单指标多臂赌博机:具有未知奖励函数的广义线性上下文赌博机

机器学习 2026-02-10 v3 机器学习

摘要

广义线性赌博机因其在线决策问题中的广泛适用性而受到广泛研究。然而,这些方法通常假设期望奖励函数为用户已知,这一假设在实际中往往不现实。该链接函数的错误指定可能导致所有现有算法的失败。在这项工作中,我们通过引入广义线性赌博机与未知奖励函数的新问题(即单指标赌博机)来解决这一关键限制。我们首先考虑未知奖励函数单调递增的情况,并提出两种新颖高效的算法 STOR 和 ESTOR,在标准假设下实现了合理的遗憾界。值得注意的是,我们的 ESTOR 在时间跨度 T 方面可以达到接近最优的遗憾界 O~T(T)\tilde{O}_T(\sqrt{T})。然后我们将方法扩展到高维稀疏设置,并表明相同的遗憾率可以与稀疏指数一同达到。接下来,我们引入 GSTOR,一种对一般奖励函数无关的算法,并在高斯设计假设下建立遗憾界。最后,我们通过在合成和真实数据集上的实验验证了算法的有效性和效率。

关键词

引用

@article{arxiv.2506.12751,
  title  = {Single Index Bandits: Generalized Linear Contextual Bandits with Unknown Reward Functions},
  author = {Yue Kang and Mingshuo Liu and Bongsoo Yi and Jing Lyu and Zhi Zhang and Doudou Zhou and Yao Li},
  journal= {arXiv preprint arXiv:2506.12751},
  year   = {2026}
}

备注

The Fourteenth International Conference on Learning Representations (ICLR 2026)