中文

基于 UCB 探索的神经上下文老虎机

机器学习 2020-07-03 v3 机器学习

摘要

我们研究随机上下文老虎机问题,其中奖励由带加性噪声的未知函数生成。除有界性外,不对奖励函数作任何假设。我们提出一种新算法 NeuralUCB,它利用深度神经网络的表示能力,并使用基于神经网络的随机特征映射来构造奖励的上置信界(UCB)以进行高效探索。我们证明,在标准假设下,NeuralUCB 达到 O~(T)\tilde O(\sqrt{T}) 后悔,其中 TT 为轮数。据我们所知,这是首个具有近最优后悔保证的基于神经网络的上下文老虎机算法。我们还通过在若干基准中对比代表性基线,展示了该算法在经验上的竞争力。

关键词

引用

@article{arxiv.1911.04462,
  title  = {Neural Contextual Bandits with UCB-based Exploration},
  author = {Dongruo Zhou and Lihong Li and Quanquan Gu},
  journal= {arXiv preprint arXiv:1911.04462},
  year   = {2020}
}

备注

27 pages, 2 figures, 1 table. In ICML 2020