中文

具有深度表示与浅层探索的神经方差感知对决老虎机

机器学习 2026-05-12 v2 机器学习

摘要

本文通过提出利用神经网络逼近非线性效用函数的方差感知算法,来解决上下文对决老虎机问题。我们的方法采用方差感知探索策略,该策略自适应地考虑了成对比较中的不确定性,同时仅依赖于最后一层可学习参数的梯度。这种设计在 Upper Confidence Bound (UCB) 和 Thompson Sampling (TS) 框架下都有效地平衡了探索-利用权衡。因此,在标准假设下,我们建立了理论保证,表明我们的算法对于足够宽的神经网络实现了阶为 \bigol<(dt=1Tσt2+dT\rt)\bigol\lt(d \sqrt{\sum_{t=1}^T \sigma_t^2} + \sqrt{dT}\rt) 的次线性累积平均遗憾,其中 d d 是上下文维度,σt2 \sigma_t^2 是第 t t 轮比较的方差,T T 是总轮数。我们还通过实验验证了我们的方法具有合理的计算效率,并在具有非线性效用的合成任务和真实世界任务中均实现了次线性遗憾,优于现有方法。

关键词

引用

@article{arxiv.2506.01250,
  title  = {Neural Variance-aware Dueling Bandits with Deep Representation and Shallow Exploration},
  author = {Youngmin Oh and Jinje Park and Taejin Paik and Jaemin Park},
  journal= {arXiv preprint arXiv:2506.01250},
  year   = {2026}
}