中文

面向 $f$-散度正则化情境赌博机离线策略学习的精确分析

机器学习 2026-02-27 v3 人工智能 统计理论 机器学习 统计理论

摘要

许多离线强化学习算法都以 ff-散度正则化为基础,但它们*相对于正则化目标定义的*样本复杂性仍然缺乏严格的分析,尤其是在具体的数据覆盖条件方面。在本文中,我们研究了离线 ff-散度正则化上下文赌博机达到 Θ~(ϵ1)\tilde{\Theta}(\epsilon^{-1}) 样本复杂性所需的精确可集中性要求。对于反向 Kullback-Leibler (KL) 散度,这可以说是最常用的一种,我们首次通过一种新颖的基于悲观主义的分析,在单策略可集中性下实现了 O~(ϵ1)\tilde{O}(\epsilon^{-1}) 的样本复杂性,超越了现有全策略可集中性下的 O~(ϵ1)\tilde{O}(\epsilon^{-1}) 界和单策略可集中性下的 O~(ϵ2)\tilde{O}(\epsilon^{-2}) 界。我们还提出了一个近乎匹配的下界,证明了要最大程度地利用反向 KL 的曲率特性,对单策略可集中性的乘性依赖是必要的。此外,对于具有强凸 ffff-散度(反向 KL *不*属于此类),我们证明了即使在无悲观估计或单策略可集中性的情况下,也能实现精确的样本复杂性 Θ~(ϵ1)\tilde{\Theta}(\epsilon^{-1})。我们进一步通过数值实验证实了我们的理论见解,并将我们的分析扩展到上下文对决赌博机。我们相信,这些结果为全面理解具有 ff-散度正则化的目标迈出了重要一步。

关键词

引用

@article{arxiv.2502.06051,
  title  = {Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits},
  author = {Qingyue Zhao and Kaixuan Ji and Heyang Zhao and Tong Zhang and Quanquan Gu},
  journal= {arXiv preprint arXiv:2502.06051},
  year   = {2026}
}

备注

35 pages