中文

利用扩展 D-最优探索在离线数据辅助的线性赌博机中实现遗憾最小化

机器学习 2026-05-13 v3 机器学习

摘要

我们研究了在可访问来自底层赌博机模型的先验观测(离线数据)的情况下,线性赌博机中的在线遗憾最小化问题。在推荐系统、在线广告等众多应用中,通常存在大量离线数据。因此,该问题在近期文献中得到了深入研究。我们的算法,离线-在线分阶段消除(OOPE),有效地整合了离线数据,与先前工作相比显著降低了在线遗憾。为了谨慎地利用离线信息,OOPE 在每个探索阶段使用扩展的 D-最优设计。OOPE 实现的在线遗憾为 O~(\deffTlog(AT)+d2)\tilde{O}(\sqrt{\deff T \log \left(|\mathcal{A}|T\right)}+d^2)\deffd)\deff \leq d) 是有效问题维度,它衡量了离线数据中探索不足的方向数量,并取决于离线数据 Gram 矩阵的特征谱 (λk)k[d](\lambda_k)_{k \in [d]}。特征谱 (λk)k[d](\lambda_k)_{k \in [d]} 是离线数据\emph{质量}的量化度量。如果离线数据探索不足(\deffd\deff \approx d),我们恢复到纯在线设置下已建立的遗憾界;而当离线数据充足(\Toff>>T\Toff >> T)且探索良好(\deff=o(1)\deff = o(1))时,在线遗憾会显著降低。此外,我们提供了该设置下首个已知的、明确依赖于离线数据质量的极小极大遗憾下界。这些下界确立了我们的算法在离线数据探索良好或探索不足情况下的最优性。最后,通过使用 Frank-Wolfe 近似扩展最优设计,我们将 O(d2)O(d^{2}) 项进一步改进为 O(d2\deffmin{\deff,1})O\left(\frac{d^{2}}{\deff} \min \{ \deff,1\} \right),这在具有中等质量离线数据 \deff=Ω(1)\deff = \Omega(1) 的高维情况下可能非常显著。

关键词

引用

@article{arxiv.2508.08420,
  title  = {Regret minimization in Linear Bandits with offline data via extended D-optimal exploration},
  author = {Sushant Vijayan and Arun Suggala and Karthikeyan Shanmugam and Soumyabrata Pal},
  journal= {arXiv preprint arXiv:2508.08420},
  year   = {2026}
}

备注

Accepted to TMLR, with J2C certification, link: https://openreview.net/forum?id=4WcK8gKgCi