中文

线性-高斯型多臂赫尔墨斯问题中的先验可分离性与后悔

机器学习 2026-01-06 v1

摘要

我们证明了在线性-高斯型多臂赫尔墨斯问题中,Thompson 抽样具有 O~(σdT+drTr(Σ0))\tilde{O}(\sigma d \sqrt{T} + d r \sqrt{\mathrm{Tr}(\Sigma_0)}) 贝叶斯后悔,其中 dd 为维数,TT 为时间范围,rr 为最大 2\ell_2 范数动作,σ2\sigma^2 为噪声方差。在与现有后悔上界不同的是,这表明在对数因子内,先验依赖的“burn-in”项 drTr(Σ0)d r \sqrt{\mathrm{Tr}(\Sigma_0)} 加法地与最小后悔(长期)后悔 σdT\sigma d \sqrt{T} 分离。以往的后悔上界显示,这些术语具有乘法依赖关系。我们通过一种新的“椭圆潜势”引理建立了这些结果,也提供了一个下界,表明 burn-in 项是不可避免的。

关键词

引用

@article{arxiv.2601.02022,
  title  = {Prior Diffusiveness and Regret in the Linear-Gaussian Bandit},
  author = {Yifan Zhu and John C. Duchi and Benjamin Van Roy},
  journal= {arXiv preprint arXiv:2601.02022},
  year   = {2026}
}