具有监督学习保证的上下文赌博机算法
机器学习
2011-10-28 v3
摘要
我们解决了在线赌博机设置中的学习问题,在该设置中,学习器必须反复从个动作中选择,但仅基于其选择接收部分反馈。我们建立了两个新事实:首先,使用一种称为Exp4.P的新算法,我们表明可以与一组个专家中的最佳专家竞争,概率为,同时在个时间步长内产生的遗憾最多为。该新算法在大型真实世界数据集上进行了实证测试。其次,我们给出了一种称为VE的新算法,该算法与VC维数为的可能是无限策略集竞争,同时在概率为的情况下产生的遗憾最多为。这些保证改进了所有先前算法(无论是在随机环境还是对抗环境中)的保证,并使我们更接近于为上下文赌博机设置提供监督学习类型的保证。
引用
@article{arxiv.1002.4058,
title = {Contextual Bandit Algorithms with Supervised Learning Guarantees},
author = {Alina Beygelzimer and John Langford and Lihong Li and Lev Reyzin and Robert E. Schapire},
journal= {arXiv preprint arXiv:1002.4058},
year = {2011}
}
备注
10 pages