中文

非线性情境多臂老虎机的可证明即时集成采样算法

机器学习 2026-05-12 v2 人工智能 机器学习

摘要

我们提供了一个统一的算法框架,用于非线性情境多臂老虎机的集成采样,并为两种最常见的非线性情境多臂老虎机设置对应的 regret 界:针对广义线性老虎机的广义线性集成采样(GLM-ES),以及针对神经网络情境老虎机的神经集成采样(Neural-ES)。这两种方法通过对随机扰动数据上执行最大似然估计来维护多个奖励模型参数的估计器。我们证明了 GLM-ES 和 Neural-ES 的高概率频繁性 regret 界分别为 O~(d3/2T+d4)\widetilde{O}(d^{3/2} \sqrt{T} + d^{4})O~(d~3/2T)\widetilde{{O}}(\widetilde{d}^{3/2} \sqrt{T}),其中 dd 为特征向量的维数,d~\widetilde{d} 为神经切线核(NTK)矩阵的有效维数,TT 为轮数。GLM-ES 的 regret 界与广义线性老虎机设置下随机探索算法的最新结果相匹配。在理论分析中,我们引入针对非线性模型特有的挑战所需的技术。在实际操作中,我们通过开发 our algorithms 的即时版本来消除固定时间范围的假设,适用于 TT 未知的情况。最后,我们经验评估了 GLM-ES、Neural-ES 及其即时变体,显示出强大的性能。总体而言,我们的结果确立了集成采样作为非线性情境多臂老虎机可证明且实用的随机探索方法。

关键词

引用

@article{arxiv.2510.10730,
  title  = {Provable Anytime Ensemble Sampling Algorithms in Nonlinear Contextual Bandits},
  author = {Jiazheng Sun and Weixin Wang and Pan Xu},
  journal= {arXiv preprint arXiv:2510.10730},
  year   = {2026}
}

备注

58 pages, 5 figures, 1 table