可上下文合并的随机_bandit
机器学习
2023-11-29 v2
摘要
我们考虑一个具有 个上下文和 个动作的情境化 bandit 问题。在每轮 中,学习者观测一个随机上下文并基于过往经验选择动作。随后学习者观测一个随机奖励,其均值是该轮上下文与动作的函数。在上下文可被合并为 个组、使得同组内任意两个上下文对各动作的均值奖励相同的假设下,我们给出一种算法,能以高概率在使用至多 个样本后输出 -最优策略,并给出匹配的 下界。在遗憾最小化设定中,我们给出一种算法,其至时刻 的累积遗憾以 为界。据我们所知,我们首次给出了该问题在 PAC 设定下的近最优样本复杂度,以及在线设定下 的极小极大遗憾。我们还展示了我们的算法可应用于更一般的低秩 bandit,并在某些情形下获得改进的遗憾界。
引用
@article{arxiv.2306.13053,
title = {Context-lumpable stochastic bandits},
author = {Chung-Wei Lee and Qinghua Liu and Yasin Abbasi-Yadkori and Chi Jin and Tor Lattimore and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2306.13053},
year = {2023}
}