具有多样化上下文的随机线性上下文_bandits
机器学习
2020-03-06 v1 信息论
math.IT
机器学习
摘要
本文研究上下文多样性对随机线性上下文_bandits 的影响。与先前认为上下文导致 bandit 学习更困难的观点相反,我们表明当上下文足够多样时,学习器能够利用在利用阶段获得的信息来缩短探索过程,从而实现更低的后悔值。我们设计了 LinUCB-d 算法,并提出一种分析其后悔性能的新方法。主要理论结果表明,在多样化上下文假设下,LinUCB-d 的累积期望后悔值被一个常数所界定。作为副产品,我们的结果改进了先前对 LinUCB 的理解并强化了其性能保证。
引用
@article{arxiv.2003.02681,
title = {Stochastic Linear Contextual Bandits with Diverse Contexts},
author = {Weiqiang Wu and Jing Yang and Cong Shen},
journal= {arXiv preprint arXiv:2003.02681},
year = {2020}
}
备注
Accepted to AISTATS 2020