中文

可上下文合并的随机_bandit

机器学习 2023-11-29 v2

摘要

我们考虑一个具有 SS 个上下文和 KK 个动作的情境化 bandit 问题。在每轮 t=1,2,t=1,2,\dots 中,学习者观测一个随机上下文并基于过往经验选择动作。随后学习者观测一个随机奖励,其均值是该轮上下文与动作的函数。在上下文可被合并为 rmin{S,K}r\le \min\{S,K\} 个组、使得同组内任意两个上下文对各动作的均值奖励相同的假设下,我们给出一种算法,能以高概率在使用至多 O~(r(S+K)/ϵ2)\widetilde O(r (S +K )/\epsilon^2) 个样本后输出 ϵ\epsilon-最优策略,并给出匹配的 Ω(r(S+K)/ϵ2)\Omega(r(S+K)/\epsilon^2) 下界。在遗憾最小化设定中,我们给出一种算法,其至时刻 TT 的累积遗憾以 O~(r3(S+K)T)\widetilde O(\sqrt{r^3(S+K)T}) 为界。据我们所知,我们首次给出了该问题在 PAC 设定下的近最优样本复杂度,以及在线设定下 O~(poly(r)(S+K)T)\widetilde O(\sqrt{{poly}(r)(S+K)T}) 的极小极大遗憾。我们还展示了我们的算法可应用于更一般的低秩 bandit,并在某些情形下获得改进的遗憾界。

关键词

引用

@article{arxiv.2306.13053,
  title  = {Context-lumpable stochastic bandits},
  author = {Chung-Wei Lee and Qinghua Liu and Yasin Abbasi-Yadkori and Chi Jin and Tor Lattimore and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2306.13053},
  year   = {2023}
}