强化学习的PAC保证:样本复杂度、覆盖与结构
机器学习
2026-03-03 v1 机器学习
摘要
当数据稀缺或错误代价高昂时,平均情况指标就不够了。实践者需要的是一种保证:在N个episodes后,以至少的概率,学习到的政策与最优政策相距。这就是PAC承诺,自2018年至2025年,强化学习理论社区在这类承诺何时可以实现方面取得了显著进展。我们对该进展进行了概述。我们的组织工具是Coverage-Structure-Objective(CSO)框架,该框架被提出用于将几乎每个PAC样本复杂度结果分解为三个因素:覆盖(数据获取方式)、结构(内在MDP或函数类复杂度)、目标(学习者必须提供的内容)。CSO不是定理,而是一种解释模板,识别瓶颈,使跨情境比较立即可见。技术核心涵盖紧密的tabular基线和到regret的uniform-PAC桥接;结构复杂度度量(Bellman秩、见证秩、Bellman-Eluder维数)支配函数逼近下的可学习性;线性、核/NTK和低秩模型的结果;奖励自由探索作为覆盖投资;以及其中继离线RL,其中继承的覆盖是决定性约束。我们提供实践工具:按CSO坐标索引的速查表、Bellman残差诊断、覆盖估计伴随部署门控、以及每episode政策证书。最后一节列出开放问题,将近期目标与覆盖、结构和计算交织的前沿问题分开,后者是当前理论无法解决的。
引用
@article{arxiv.2603.01309,
title = {PAC Guarantees for Reinforcement Learning: Sample Complexity, Coverage, and Structure},
author = {Joshua Steier},
journal= {arXiv preprint arXiv:2603.01309},
year = {2026}
}
备注
43 pages