中文

面向情境型边戒的方差感知满意抽样Thompson采样

机器学习 2025-11-05 v1 最优化与控制 机器学习

摘要

方差相关的regret界限近年来受到越来越多的关注,但大多数研究聚焦于基于上置信界(UCB)的边戒算法,而基于抽样的边戒算法如Thompson采样仍受到较少关注。唯一的例外是LinVDTS算法(Xu等,2023),其仅限于线性奖励函数,且其regret界限相对于模型维度并非最优。本文提出了FGTSVA,一种针对具有一般奖励函数的情境型边戒的方差感知Thompson采样算法,具备最优的regret界限。我们分析的核心是对解耦系数的扩展,这是Feel-good Thompson采样(FGTS)分析中常用的方法,反映了模型空间的复杂性。通过新的解耦系数记为 dc\mathrm{dc},FGTS-VA 实现的regret为 O~(dclogFt=1Tσt2+dc)\tilde{O}(\sqrt{\mathrm{dc}\cdot\log|\mathcal{F}|\sum_{t=1}^T\sigma_t^2}+\mathrm{dc}),其中 F|\mathcal{F}| 是模型空间的大小, TT 是总轮数, σt2\sigma_t^2 是第 tt 轮噪声的子高斯范数(例如,当噪声为高斯时为方差)。在情境线性边戒设置下,FGTSVA的regret界限与使用加权线性回归的UCB-based算法(Zhou和Gu,2022)的regret界限一致。

关键词

引用

@article{arxiv.2511.02123,
  title  = {Variance-Aware Feel-Good Thompson Sampling for Contextual Bandits},
  author = {Xuheng Li and Quanquan Gu},
  journal= {arXiv preprint arXiv:2511.02123},
  year   = {2025}
}

备注

19 pages, 2 figures, 39th Conference on Neural Information Processing Systems (NeurIPS 2025)