中文

具有多样化上下文的随机线性上下文_bandits

机器学习 2020-03-06 v1 信息论 math.IT 机器学习

摘要

本文研究上下文多样性对随机线性上下文_bandits 的影响。与先前认为上下文导致 bandit 学习更困难的观点相反,我们表明当上下文足够多样时,学习器能够利用在利用阶段获得的信息来缩短探索过程,从而实现更低的后悔值。我们设计了 LinUCB-d 算法,并提出一种分析其后悔性能的新方法。主要理论结果表明,在多样化上下文假设下,LinUCB-d 的累积期望后悔值被一个常数所界定。作为副产品,我们的结果改进了先前对 LinUCB 的理解并强化了其性能保证。

关键词

引用

@article{arxiv.2003.02681,
  title  = {Stochastic Linear Contextual Bandits with Diverse Contexts},
  author = {Weiqiang Wu and Jing Yang and Cong Shen},
  journal= {arXiv preprint arXiv:2003.02681},
  year   = {2020}
}

备注

Accepted to AISTATS 2020