线性-高斯型多臂赫尔墨斯问题中的先验可分离性与后悔
机器学习
2026-01-06 v1
摘要
我们证明了在线性-高斯型多臂赫尔墨斯问题中,Thompson 抽样具有 贝叶斯后悔,其中 为维数, 为时间范围, 为最大 范数动作, 为噪声方差。在与现有后悔上界不同的是,这表明在对数因子内,先验依赖的“burn-in”项 加法地与最小后悔(长期)后悔 分离。以往的后悔上界显示,这些术语具有乘法依赖关系。我们通过一种新的“椭圆潜势”引理建立了这些结果,也提供了一个下界,表明 burn-in 项是不可避免的。
引用
@article{arxiv.2601.02022,
title = {Prior Diffusiveness and Regret in the Linear-Gaussian Bandit},
author = {Yifan Zhu and John C. Duchi and Benjamin Van Roy},
journal= {arXiv preprint arXiv:2601.02022},
year = {2026}
}