通过扰动奖励学习神经上下文老虎机
机器学习
2022-03-22 v2
摘要
得益于表示学习的能力,神经上下文老虎机算法相比传统算法表现出显著的性能提升。然而,由于其探索必须在整个神经网络参数空间中进行才能获得近乎最优的遗憾,由此产生的计算成本高得令人望而却步。我们在更新神经网络时扰动奖励,以消除显式探索的需求及相应的计算开销。我们证明,在标准正则性条件下,仍可实现 的遗憾上界,其中 是交互轮数, 是神经正切核矩阵的有效维度。与包括两种近期神经上下文老虎机模型在内的多个基准上下文老虎机算法的广泛比较,证明了我们提出的神经老虎机算法的有效性和计算效率。
引用
@article{arxiv.2201.09910,
title = {Learning Neural Contextual Bandits Through Perturbed Rewards},
author = {Yiling Jia and Weitong Zhang and Dongruo Zhou and Quanquan Gu and Hongning Wang},
journal= {arXiv preprint arXiv:2201.09910},
year = {2022}
}