中文

更精确的误指定核化bandit优化保证

机器学习 2026-05-08 v1 最优化与控制 机器学习

摘要

现有的误指定核化bandit优化保证通过核复杂度来衡量误指定代价:在通用的离线界限中,误指定水平ε\varepsilon被乘以deff\sqrt{d_\mathrm{eff}},其中deffd_\mathrm{eff}为核的有效维数;而在在线regret界限中,相应的惩罚为γnnε\sqrt{\gamma_n}\,n\varepsilon,其中γn\gamma_nnn轮交互后的最大信息增益。在本文中,我们表明,对于大类核函数,误指定放大可以降低为对数或多项对数增长。在离线设置下,我们首先证明了高概率简单regret界限,其误指定项由谱Lebesgue常数控制。这导致对一维单调谱和多变量Fourier-对角积核实现对数或多项对数放大。在在线设置下,我们修改域分割算法,证明了在温和的局部特征衰减假设下,累积regret界限为O~(γnn+nε)\widetilde{\mathcal O}(\sqrt{\gamma_n n}+n\varepsilon),从误指定项中去除了额外的γn\sqrt{\gamma_n}因子。普遍原则是局部化:谱局部化控制离线逼近算子的Lebesgue常数,而域分割在在线设置中实现了这一机制的空间类比,防止局部误指定误差被放大为全局误差。

关键词

引用

@article{arxiv.2605.05967,
  title  = {Sharper Guarantees for Misspecified Kernelized Bandit Optimization},
  author = {Davide Maran and Csaba Szepesvári},
  journal= {arXiv preprint arXiv:2605.05967},
  year   = {2026}
}