中文

批量神经老虎机

机器学习 2021-02-26 v1 机器学习

摘要

在许多序贯决策问题中,个体被划分为若干批次,决策者在每批结束时才被允许更改其策略。这类批处理问题有大量应用,从临床试验到众包不一而足。受此驱动,我们研究批量设定下一般奖励分布的随机上下文老虎机问题。我们提出 BatchNeuralUCB 算法,该算法将神经网络与乐观主义相结合,在限制批次总数的同时应对探索-利用权衡。我们在固定与自适应批大小两种设定下研究 BatchNeuralUCB,并证明其虽大幅减少策略更新次数,却取得了与全序贯版本相同的后悔界。我们在合成与真实世界数据集上的仿真验证了我们的理论结果。

关键词

引用

@article{arxiv.2102.13028,
  title  = {Batched Neural Bandits},
  author = {Quanquan Gu and Amin Karbasi and Khashayar Khosravi and Vahab Mirrokni and Dongruo Zhou},
  journal= {arXiv preprint arXiv:2102.13028},
  year   = {2021}
}

备注

21 pages, 7 figures