中文

具有监督学习保证的上下文赌博机算法

机器学习 2011-10-28 v3

摘要

我们解决了在线赌博机设置中的学习问题,在该设置中,学习器必须反复从KK个动作中选择,但仅基于其选择接收部分反馈。我们建立了两个新事实:首先,使用一种称为Exp4.P的新算法,我们表明可以与一组NN个专家中的最佳专家竞争,概率为1δ1-\delta,同时在TT个时间步长内产生的遗憾最多为O(KTln(N/δ))O(\sqrt{KT\ln(N/\delta)})。该新算法在大型真实世界数据集上进行了实证测试。其次,我们给出了一种称为VE的新算法,该算法与VC维数为dd的可能是无限策略集竞争,同时在概率为1δ1-\delta的情况下产生的遗憾最多为O(T(dln(T)+ln(1/δ)))O(\sqrt{T(d\ln(T) + \ln (1/\delta))})。这些保证改进了所有先前算法(无论是在随机环境还是对抗环境中)的保证,并使我们更接近于为上下文赌博机设置提供监督学习类型的保证。

关键词

引用

@article{arxiv.1002.4058,
  title  = {Contextual Bandit Algorithms with Supervised Learning Guarantees},
  author = {Alina Beygelzimer and John Langford and Lihong Li and Lev Reyzin and Robert E. Schapire},
  journal= {arXiv preprint arXiv:1002.4058},
  year   = {2011}
}

备注

10 pages