中文

关于KL 正则化离线多臂老虎机的最优样本复杂度

机器学习 2026-05-05 v1 人工智能 统计理论 机器学习 统计理论

摘要

Kullback-Leibler (KL) 正则化在离线决策中广泛使用,具有多项优势,推动了近期关于KL 正则化性能指标下离线学习样本复杂度的工作。尽管如此,KL 正则化离线学习的确切样本复杂度仍在很大程度上未被完全表征。在本文中,我们在多臂老虎机 (MABs) 的设置下研究此问题。我们对 KL-PCB(Zhao 等,2026)进行尖锐分析,显示它在大正则化 η=O~(ϵ1)\eta = \tilde{O}(\epsilon^{-1}) 时实现样本复杂度 O~(ηSACπ/ϵ)\tilde{O}(\eta SAC^{\pi^*}/\epsilon),在小正则化 η=O~(ϵ1)\eta = \tilde{O}(\epsilon^{-1}) 时实现样本复杂度 Ω~(SACπ/ϵ2)\tilde{\Omega}(SAC^{\pi^*}/\epsilon^2),其中 η\eta 为正则化参数,SS 为情境数,AA 为臂数,CπC^{\pi^*} 为最优策略 π\pi^* 下的策略覆盖系数,ϵ\epsilon 为所需次优性,O~\tilde{O}Ω~\tilde{\Omega} 隐藏所有多对数因子。我们进一步提供一对更精确的样本复杂度下界,这些下界在整个正则化强度范围内匹配上界。总体而言,我们的结果对KL 正则化离线多臂老虎机提供了近乎完整的表征。

关键词

引用

@article{arxiv.2605.02141,
  title  = {On the Optimal Sample Complexity of Offline Multi-Armed Bandits with KL Regularization},
  author = {Kaixuan Ji and Qiwei Di and Heyang Zhao and Qingyue Zhao and Quanquan Gu},
  journal= {arXiv preprint arXiv:2605.02141},
  year   = {2026}
}