神经逻辑赌博机
机器学习
2026-05-29 v2 机器学习
摘要
我们研究神经逻辑赌博机问题,其主要任务是用神经网络学习一个逻辑链接函数内的未知奖励函数。现有方法要么对 表现出不利的依赖性(其中 代表奖励分布的最小方差),要么直接依赖于特征维度 ,而在基于神经网络的设置中, 可能非常大。在这项工作中,我们为自归一化向量值鞅引入了一种新颖的伯恩斯坦型不等式,旨在绕过对环境维度的直接依赖。这使我们能够推导出一个遗憾上界,该上界随有效维度 而非特征维度增长,同时保持对 的最小依赖。基于该集中不等式,我们提出了两种算法,NeuralLog-UCB-1 和 NeuralLog-UCB-2,它们分别保证了阶为 和 的遗憾上界,改进了现有结果。最后,我们报告了在合成和真实数据集上的数值结果,以验证我们的理论发现。
引用
@article{arxiv.2505.02069,
title = {Neural Logistic Bandits},
author = {Seoungbin Bae and Dabeen Lee},
journal= {arXiv preprint arXiv:2505.02069},
year = {2026}
}