更精确的误指定核化bandit优化保证
机器学习
2026-05-08 v1 最优化与控制
机器学习
摘要
现有的误指定核化bandit优化保证通过核复杂度来衡量误指定代价:在通用的离线界限中,误指定水平被乘以,其中为核的有效维数;而在在线regret界限中,相应的惩罚为,其中为轮交互后的最大信息增益。在本文中,我们表明,对于大类核函数,误指定放大可以降低为对数或多项对数增长。在离线设置下,我们首先证明了高概率简单regret界限,其误指定项由谱Lebesgue常数控制。这导致对一维单调谱和多变量Fourier-对角积核实现对数或多项对数放大。在在线设置下,我们修改域分割算法,证明了在温和的局部特征衰减假设下,累积regret界限为,从误指定项中去除了额外的因子。普遍原则是局部化:谱局部化控制离线逼近算子的Lebesgue常数,而域分割在在线设置中实现了这一机制的空间类比,防止局部误指定误差被放大为全局误差。
关键词
引用
@article{arxiv.2605.05967,
title = {Sharper Guarantees for Misspecified Kernelized Bandit Optimization},
author = {Davide Maran and Csaba Szepesvári},
journal= {arXiv preprint arXiv:2605.05967},
year = {2026}
}