基于在线神经回归的上下文 Bandit
机器学习
2023-12-13 v1 机器学习
摘要
最近的研究表明,在可实现性假设下,上下文 bandit 可以归约为在线回归 [Foster and Rakhlin, 2020, Foster and Krishnamurthy, 2021]。在这项工作中,我们研究了将神经网络用于此类在线回归及相关的神经上下文 bandit。利用现有的关于宽网络的结果,可以很容易地证明使用平方损失的在线回归具有 的遗憾,通过该归约,这意味着 NeuCB 具有 的遗憾。脱离这种标准方法,我们首先证明,对于满足 QG(二次增长)条件(PL(Polyak-\L ojasiewicz)条件的推广)且具有唯一极小值的几乎凸损失,使用其进行在线回归具有 的遗憾。尽管由于宽网络不具有唯一极小值而无法直接应用于宽网络,但我们表明,在网络预测中加入适当的小随机扰动,令人惊讶地使得损失满足具有唯一极小值的 QG 条件。基于这种受扰动的预测,我们证明了使用平方损失和 KL 损失进行在线回归均具有 的遗憾,随后分别将其转化为 NeuCB 的 和 遗憾,其中 是最佳策略的损失。另外,我们还表明,现有的 NeuCB 遗憾界是 的,或者假设了独立同分布的上下文,这与本文的工作不同。最后,我们在各种数据集上的实验结果表明,我们的算法,特别是基于 KL 损失的算法,持续优于现有算法。
引用
@article{arxiv.2312.07145,
title = {Contextual Bandits with Online Neural Regression},
author = {Rohan Deb and Yikun Ban and Shiliang Zuo and Jingrui He and Arindam Banerjee},
journal= {arXiv preprint arXiv:2312.07145},
year = {2023}
}