面向 $f$-散度正则化情境赌博机离线策略学习的精确分析
机器学习
2026-02-27 v3 人工智能
统计理论
机器学习
统计理论
摘要
许多离线强化学习算法都以 -散度正则化为基础,但它们*相对于正则化目标定义的*样本复杂性仍然缺乏严格的分析,尤其是在具体的数据覆盖条件方面。在本文中,我们研究了离线 -散度正则化上下文赌博机达到 样本复杂性所需的精确可集中性要求。对于反向 Kullback-Leibler (KL) 散度,这可以说是最常用的一种,我们首次通过一种新颖的基于悲观主义的分析,在单策略可集中性下实现了 的样本复杂性,超越了现有全策略可集中性下的 界和单策略可集中性下的 界。我们还提出了一个近乎匹配的下界,证明了要最大程度地利用反向 KL 的曲率特性,对单策略可集中性的乘性依赖是必要的。此外,对于具有强凸 的 -散度(反向 KL *不*属于此类),我们证明了即使在无悲观估计或单策略可集中性的情况下,也能实现精确的样本复杂性 。我们进一步通过数值实验证实了我们的理论见解,并将我们的分析扩展到上下文对决赌博机。我们相信,这些结果为全面理解具有 -散度正则化的目标迈出了重要一步。
引用
@article{arxiv.2502.06051,
title = {Towards a Sharp Analysis of Offline Policy Learning for $f$-Divergence-Regularized Contextual Bandits},
author = {Qingyue Zhao and Kaixuan Ji and Heyang Zhao and Tong Zhang and Quanquan Gu},
journal= {arXiv preprint arXiv:2502.06051},
year = {2026}
}
备注
35 pages