中文

上下文老虎机的方差依赖遗憾下界

机器学习 2025-03-18 v1 人工智能 机器学习

摘要

线性上下文老虎机的方差依赖遗憾界,将经典的 Õ(d√K) 遗憾界改进为 Õ(d√Σ_{k=1}^K σ_k²),其中 d 为上下文维度,K 为轮数,σ²_k 为第 k 轮的噪声方差,近年来已被广泛研究。然而,大多数现有工作关注的是遗憾上界而非下界。据我们所知,唯一的下界来自 Jia et al. (2024),其证明对于任意 eluder 维度 d_elu 和总方差预算 Λ,存在一个实例满足 Σ_{k=1}^K σ_k² ≤ Λ,使得任何算法都面临方差依赖的下界 Ω(√(d_elu Λ))。然而,该下界与现有上界之间存在 √d 的差距。此外,它仅考虑固定的总方差预算 Λ,不适用于一般方差序列 {σ_1², …, σ_K²}。本文中,为克服 Jia et al. (2024) 的局限性,我们在两种设定下考虑一般方差序列。对于前缀序列,即整个方差序列在学习过程开始时即暴露给学习者的情形,我们为线性上下文老虎机建立了方差依赖下界 Ω(d√(Σ_{k=1}^K σ_k²) / log K)。对于自适应序列,即对手可根据历史观测在每轮 k 生成方差 σ_k² 的情形,我们证明当对手必须在观测决策集 D_k 之前生成 σ_k² 时,类似的下界 Ω(d√(Σ_{k=1}^K σ_k²) / log⁶(dK)) 依然成立。在两种设定下,我们的结果在忽略对数因子的意义下与 SAVE 算法(Zhao et al., 2023)的上界相匹配。

关键词

引用

@article{arxiv.2503.12020,
  title  = {Variance-Dependent Regret Lower Bounds for Contextual Bandits},
  author = {Jiafan He and Quanquan Gu},
  journal= {arXiv preprint arXiv:2503.12020},
  year   = {2025}
}

备注

19 pages