中文

线性 Bandit 中的切向随机化(TRAiL):保证推断与遗憾界

机器学习 2024-11-20 v1 机器学习 系统与控制 系统与控制

摘要

我们提出并分析了 TRAiL(线性 Bandit 中的切向随机化),这是一种计算高效的、遗憾最优的强制探索算法,适用于动作集为强凸函数下水平集的线性 bandit 问题。TRAiL 通过标准的正则化最小二乘法估计线性 bandit 问题的控制参数,并将对应于该点估计的最大化奖励动作沿凸紧致动作集的切平面进行扰动,随后将其投影回该动作集。利用矩阵鞅的集中不等式,我们证明 TRAiL 在长度为 TT 的周期内以高概率保证推断质量(通过设计(回归)矩阵的最小特征值衡量)的 Ω(T)\Omega(\sqrt{T}) 增长。基于此结果,我们在 TT 个周期内以至少 11/T1 - 1/T 的概率获得了累积遗憾的 O(Tlog(T))\mathcal{O}(\sqrt{T} \log(T)) 上界,并将 TRAiL 与其他流行的线性 bandit 算法进行了比较。然后,我们刻画了覆盖多种动作/参数集和噪声过程的任何算法在期望遗憾上的 Ω(T)\Omega(\sqrt{T}) 极小化下界。我们的分析不仅显著扩展了线性 bandit 中下界的适用范围,而且作为副产品,得出了遗憾与推断质量之间的权衡。具体而言,我们证明任何具有 O(Tα)\mathcal{O}(T^\alpha) 期望遗憾增长的算法,其期望推断质量必然具有 Ω(T1α)\Omega(T^{1-\alpha}) 的渐近增长。我们在以 LpL^p 单位球作为动作集上的实验揭示了该关系如何被违反,但这仅在短期内发生,随后渐近地恢复以遵守该界限。实际上,遗憾最小化算法必须具有恰好合适的推断速率——过快或过慢的推断都将导致次优的遗憾增长。

关键词

引用

@article{arxiv.2411.12154,
  title  = {Tangential Randomization in Linear Bandits (TRAiL): Guaranteed Inference and Regret Bounds},
  author = {Arda Güçlü and Subhonmesh Bose},
  journal= {arXiv preprint arXiv:2411.12154},
  year   = {2024}
}

备注

42 pages, 6 Figures