在黑盒上下文_bandit算法集合上的速率自适应模型选择
机器学习
2020-06-09 v1 机器学习
摘要
我们考虑随机上下文_bandit设定中的模型选择任务。假设给定一组基上下文_bandit算法。我们提供一种主算法,将其组合并在常数因子范围内达到最佳基算法单独运行时的性能。我们的方法仅要求每个算法满足高概率后悔界。我们的过程非常简单,本质上如下:对于精心选择的概率序列 ,在每轮 ,它以概率 随机选择在哪个候选上跟随,或以概率 在每个候选的相同内部样本量下比较各自的累积奖励,并选择比较胜出者。据我们所知,我们的方案是首个对一组通用黑盒上下文_bandit算法实现速率自适应的:它达到与最佳候选相同的后悔率。我们通过仿真研究证明了方法的有效性。
引用
@article{arxiv.2006.03632,
title = {Rate-adaptive model selection over a collection of black-box contextual bandit algorithms},
author = {Aurélien F. Bibaut and Antoine Chambaz and Mark J. van der Laan},
journal= {arXiv preprint arXiv:2006.03632},
year = {2020}
}