中文

广义核化多臂赌博: novel self-normalized Bernstein-like dimension-free 不等式与 regret 上界

机器学习 2025-12-12 v2 机器学习

摘要

我们研究了广义核化多臂赌博 (GKBs) 中的 regret 最小化问题,即优化未知函数 f*,其属于再现性核希尔伯特空间 (RKHS),且可获得由指数族 (EF) 奖励模型生成的样本,其中均值是非线性函数 μ(f*)。该设置扩展了核化多臂赌博 (KBs) 和广义线性多臂赌博 (GLBs),提供了两种设置的统一视角。我们提出了乐观的 regret 最小化算法 GKB-UCB,并解释了现有用于 KBs 和 GLBs 的自归一化浓度不等式为何无法提供紧致的 regret 保证。因此,我们构建了一个适用于具有有界范数 Hilbert 空间中函数的新型自归一化 Bernstein-like dimension-free 不等式,这一成果具有独立的兴趣。基于它,我们分析 GKB-UCB,推导出 regret 上界为 Õ(γ_T √(T/κ_*)),其中 T 为学习时域,γ_T 为最大信息增益,κ_* 为描述预期奖励非线性大小的系数。我们的结果在 T、γ_T 和 κ_* 上的依赖关系对 KBs 和 GLBs 都紧密。最后,我们提出了可行版本 GKB-UCB,Trac-GKB-UCB,后者获得类似的 regret 保证,并讨论了其时间和空间复杂度。

关键词

引用

@article{arxiv.2508.01681,
  title  = {Generalized Kernelized Bandits: A Novel Self-Normalized Bernstein-Like Dimension-Free Inequality and Regret Bounds},
  author = {Alberto Maria Metelli and Simone Drago and Marco Mussi},
  journal= {arXiv preprint arXiv:2508.01681},
  year   = {2025}
}