中文

神经逻辑赌博机

机器学习 2026-05-29 v2 机器学习

摘要

我们研究神经逻辑赌博机问题,其主要任务是用神经网络学习一个逻辑链接函数内的未知奖励函数。现有方法要么对 κ\kappa 表现出不利的依赖性(其中 1/κ1/\kappa 代表奖励分布的最小方差),要么直接依赖于特征维度 dd,而在基于神经网络的设置中,dd 可能非常大。在这项工作中,我们为自归一化向量值鞅引入了一种新颖的伯恩斯坦型不等式,旨在绕过对环境维度的直接依赖。这使我们能够推导出一个遗憾上界,该上界随有效维度 d~\widetilde{d} 而非特征维度增长,同时保持对 κ\kappa 的最小依赖。基于该集中不等式,我们提出了两种算法,NeuralLog-UCB-1 和 NeuralLog-UCB-2,它们分别保证了阶为 O~(d~κT)\widetilde{O}(\widetilde{d}\sqrt{\kappa T})O~(d~T/κ)\widetilde{O}(\widetilde{d}\sqrt{T/\kappa}) 的遗憾上界,改进了现有结果。最后,我们报告了在合成和真实数据集上的数值结果,以验证我们的理论发现。

关键词

引用

@article{arxiv.2505.02069,
  title  = {Neural Logistic Bandits},
  author = {Seoungbin Bae and Dabeen Lee},
  journal= {arXiv preprint arXiv:2505.02069},
  year   = {2026}
}