中文

上下文赌博机的神经利用与探索

机器学习 2026-04-07 v3

摘要

在本文中,我们研究利用神经网络对上下文多臂赌博机进行利用与探索。上下文多臂赌博机已被研究数十年并拥有各类应用。为解决赌博机中的利用-探索权衡,主要有三种技术:epsilon-greedy、Thompson Sampling (TS) 和 Upper Confidence Bound (UCB)。在近期文献中,一系列神经赌博机算法被提出以适配非线性奖励函数,并结合 TS 或 UCB 策略进行探索。在本文中,不同于以往方法计算基于大偏差的统计界用于探索,我们提出“EE-Net”,一种新颖的基于神经网络的利用与探索策略。除使用神经网络(利用网络)学习奖励函数外,EE-Net 使用另一神经网络(探索网络)自适应地学习相较于当前估计奖励的潜在增益以用于探索。我们给出 EE-Net 的基于实例的 O~(T)\widetilde{\mathcal{O}}(\sqrt{T}) 遗憾上界,并表明 EE-Net 在真实世界数据集上优于相关的线性和神经上下文赌博机基线。

关键词

引用

@article{arxiv.2305.03784,
  title  = {Neural Exploitation and Exploration of Contextual Bandits},
  author = {Yikun Ban and Yuchen Yan and Arindam Banerjee and Jingrui He},
  journal= {arXiv preprint arXiv:2305.03784},
  year   = {2026}
}

备注

Journal of Machine Learning Research