中文

在黑盒上下文_bandit算法集合上的速率自适应模型选择

机器学习 2020-06-09 v1 机器学习

摘要

我们考虑随机上下文_bandit设定中的模型选择任务。假设给定一组基上下文_bandit算法。我们提供一种主算法,将其组合并在常数因子范围内达到最佳基算法单独运行时的性能。我们的方法仅要求每个算法满足高概率后悔界。我们的过程非常简单,本质上如下:对于精心选择的概率序列 (pt)t1(p_{t})_{t\geq 1},在每轮 tt,它以概率 ptp_{t} 随机选择在哪个候选上跟随,或以概率 1pt1-p_{t} 在每个候选的相同内部样本量下比较各自的累积奖励,并选择比较胜出者。据我们所知,我们的方案是首个对一组通用黑盒上下文_bandit算法实现速率自适应的:它达到与最佳候选相同的后悔率。我们通过仿真研究证明了方法的有效性。

关键词

引用

@article{arxiv.2006.03632,
  title  = {Rate-adaptive model selection over a collection of black-box contextual bandit algorithms},
  author = {Aurélien F. Bibaut and Antoine Chambaz and Mark J. van der Laan},
  journal= {arXiv preprint arXiv:2006.03632},
  year   = {2020}
}