基于 UCB 探索的神经上下文老虎机
机器学习
2020-07-03 v3 机器学习
摘要
我们研究随机上下文老虎机问题,其中奖励由带加性噪声的未知函数生成。除有界性外,不对奖励函数作任何假设。我们提出一种新算法 NeuralUCB,它利用深度神经网络的表示能力,并使用基于神经网络的随机特征映射来构造奖励的上置信界(UCB)以进行高效探索。我们证明,在标准假设下,NeuralUCB 达到 后悔,其中 为轮数。据我们所知,这是首个具有近最优后悔保证的基于神经网络的上下文老虎机算法。我们还通过在若干基准中对比代表性基线,展示了该算法在经验上的竞争力。
引用
@article{arxiv.1911.04462,
title = {Neural Contextual Bandits with UCB-based Exploration},
author = {Dongruo Zhou and Lihong Li and Quanquan Gu},
journal= {arXiv preprint arXiv:1911.04462},
year = {2020}
}
备注
27 pages, 2 figures, 1 table. In ICML 2020