关于KL 正则化离线多臂老虎机的最优样本复杂度
机器学习
2026-05-05 v1 人工智能
统计理论
机器学习
统计理论
摘要
Kullback-Leibler (KL) 正则化在离线决策中广泛使用,具有多项优势,推动了近期关于KL 正则化性能指标下离线学习样本复杂度的工作。尽管如此,KL 正则化离线学习的确切样本复杂度仍在很大程度上未被完全表征。在本文中,我们在多臂老虎机 (MABs) 的设置下研究此问题。我们对 KL-PCB(Zhao 等,2026)进行尖锐分析,显示它在大正则化 时实现样本复杂度 ,在小正则化 时实现样本复杂度 ,其中 为正则化参数, 为情境数, 为臂数, 为最优策略 下的策略覆盖系数, 为所需次优性, 和 隐藏所有多对数因子。我们进一步提供一对更精确的样本复杂度下界,这些下界在整个正则化强度范围内匹配上界。总体而言,我们的结果对KL 正则化离线多臂老虎机提供了近乎完整的表征。
引用
@article{arxiv.2605.02141,
title = {On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization},
author = {Kaixuan Ji and Qiwei Di and Heyang Zhao and Qingyue Zhao and Quanquan Gu},
journal= {arXiv preprint arXiv:2605.02141},
year = {2026}
}