上下文注意力赌博机:受限上下文的上下文赌博机
人工智能
2017-06-09 v2 机器学习
机器学习
摘要
我们考虑了多臂赌博机模型的一种新颖表述,我们称之为具有受限上下文的上下文赌博机,其中学习者在每次迭代中只能访问有限数量的特征。这种新颖的表述是由临床试验、推荐系统和注意力建模中出现的各种在线问题所推动的。在此,我们调整了被称为 Thompson Sampling 的标准多臂赌博机算法,以利用我们的受限上下文设置,并提出了两种新算法,分别称为具有受限上下文的 Thompson Sampling (TSRC) 和具有受限上下文的 Windows Thompson Sampling (WTSRC),用于分别处理平稳和非平稳环境。我们的实证结果证明了所提出的方法在多个真实数据集上的优势。
引用
@article{arxiv.1705.03821,
title = {Context Attentive Bandits: Contextual Bandit with Restricted Context},
author = {Djallel Bouneffouf and Irina Rish and Guillermo A. Cecchi and Raphael Feraud},
journal= {arXiv preprint arXiv:1705.03821},
year = {2017}
}
备注
IJCAI 2017