基于回归预言机的实用上下文_bandit算法
机器学习
2018-03-06 v1 机器学习
摘要
上下文_bandit(contextual bandits)的一个主要挑战是设计既实用又具有理论依据的通用算法。我们提出了一种新技术,它兼具基于可实现性方法的经验与计算优势,以及不可知方法的灵活性。我们的算法利用了值函数类的回归预言机(regression oracle)的可用性,这比不可知方法通常假设的策略上的分类预言机更为现实合理。我们的方法将 UCB 和 LinUCB 推广到更具表达力的可能模型类,并在特定分布假设下实现低后悔(regret)。在广泛的实证评估中,与基于可实现性和不可知基线相比,我们发现我们的方法通常给出相当或更优的结果。
引用
@article{arxiv.1803.01088,
title = {Practical Contextual Bandits with Regression Oracles},
author = {Dylan J. Foster and Alekh Agarwal and Miroslav Dudík and Haipeng Luo and Robert E. Schapire},
journal= {arXiv preprint arXiv:1803.01088},
year = {2018}
}