单策略浓度条件下基于前向 KL 正则化的离线情境型阈值快速收敛率
机器学习
2026-05-12 v1 人工智能
信息论
math.IT
统计理论
机器学习
统计理论
摘要
克隊-氏尔 (KL) 正则化在强化学习算法中以反向或前向 KL 形式广泛存在。最近的研究表明,在反向 KL 正则化下,决策问题可达到 类型的快速收敛率,与标准的 类型的样本复杂度形成鲜明对比。然而,对于前向 KL 正则化目标,现有的统计分析要么不可应用,要么导致 的慢速收敛率。我们首次通过对前向 KL 正则化离线情境型阈值进行简化分析,着手解决此问题。我们给出了在表格和通用函数逼近设置下的首个 上界,均基于单策略浓度概念。特别地,我们的凸分析管道通过一种新颖地方法利用乐观原则,完全绕过了基于平均值定理的前述证明流程,这可能具有独立的兴趣。此外,我们提供了率最优的下界,表明上界在统计率上具有紧致性。我们的下界还表明,前向 KL 正则化样本复杂度在低正则化 regime 下可恢复未正则化的慢速收敛率,类似于反向 KL 正则化。
引用
@article{arxiv.2605.09214,
title = {Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability},
author = {Qingyue Zhao and Kaixuan Ji and Heyang Zhao and Quanquan Gu},
journal= {arXiv preprint arXiv:2605.09214},
year = {2026}
}
备注
31 pages, comments are welcome