中文

无限臂线性上下文老虎机的紧后悔界

机器学习 2021-01-28 v3 机器学习

摘要

线性上下文老虎机是一类重要的序贯决策问题,在推荐系统、在线广告、医疗健康以及许多其他机器学习相关任务中有广泛应用。尽管已有大量先前研究,具有无限动作集的线性上下文老虎机的紧后悔界仍属开放问题。本文通过考虑具有(变化的)无限动作集的线性上下文老虎机来解决这一开放问题。我们证明了阶数为O(d2TlogT)×poly(loglogT)O(\sqrt{d^2T\log T})\times \text{poly}(\log\log T)的后悔上界,其中dd为域维度,TT为时间范围。我们的上界与[Li et al., 2019]中已有的下界Ω(d2TlogT)\Omega(\sqrt{d^2 T\log T})仅相差迭代对数项。

关键词

引用

@article{arxiv.1905.01435,
  title  = {Tight Regret Bounds for Infinite-armed Linear Contextual Bandits},
  author = {Yingkai Li and Yining Wang and Xi Chen and Yuan Zhou},
  journal= {arXiv preprint arXiv:1905.01435},
  year   = {2021}
}

备注

10 pages, accepted for presentation at AISTATS 2021