中文

BISTRO:一种基于松弛的高效上下文赌博机方法

机器学习 2016-02-09 v1 机器学习

摘要

我们针对具有独立同分布协变量、任意奖励序列和任意策略类的上下文赌博机(contextual bandits)问题提出了高效算法。我们的算法 BISTRO 每轮需要调用经验风险最小化(ERM)预言机 d 次,其中 d 为动作数。该方法利用无标签数据使问题在计算上简化。当 ERM 问题本身计算困难时,我们通过采用针对 ERM 的乘法近似算法扩展了该方法。松弛的整数间隙仅进入后悔界而非基准中。最后,我们表明只要全信息监督在线学习问题具有非平凡的后悔保证(且高效),上下文赌博机问题的对抗版本就是可学习的(且高效的)。

关键词

引用

@article{arxiv.1602.02196,
  title  = {BISTRO: An Efficient Relaxation-Based Method for Contextual Bandits},
  author = {Alexander Rakhlin and Karthik Sridharan},
  journal= {arXiv preprint arXiv:1602.02196},
  year   = {2016}
}