中文

面向自适应数据拟合 Q 迭代的测度论有限样本理论

机器学习 2026-05-08 v1

摘要

尽管强化学习(RL)在控制复杂非线性机器人系统方面展现出巨大的革命性潜力,但其从经验成功中汲取的理论仍与实际之间存在显著鸿沟,这种理论主要局限于表格或可线性化的情境。我们指出,这一鸿沟的根源在于三个传统领域的孤立:(i)基于一般空间的测度论 MDP 基础仅用于精确动态规划,忽略学习过程中所有误差来源;(ii)确定性误差传播分析通过浓度系数处理近似误差,却未对估计误差进行有限样本分析;(iii)PAC 泛化界限刻画了简化拓扑结构的估计误差。我们通过在一般可测布尔空间上构建拟合 Q 迭代(FQI)的统一理论框架,将这些传统融合为一体。我们的主要结果通过将测度论概率与巴拿赫空间中的 Bellman 算子收缩相结合,提供了自适应数据的有限样本性能界。我们证明,顺序 Rademacher 复杂度在策略依赖的数据收集下控制了 Bellman 回归的泛化。我们进一步扩展了该分析,首次为连续空间中的 FQI 提供了累积的、路径相关的在线后悔保证。这些结果为对许多现代深度 RL 算法的正式分析奠定了必要基础。

关键词

引用

@article{arxiv.2605.05791,
  title  = {A Measure-Theoretic Finite-Sample Theory for Adaptive-Data Fitted Q-Iteration},
  author = {Manuel Haussmann and Mustafa Mert Çelikok and Melih Kandemir},
  journal= {arXiv preprint arXiv:2605.05791},
  year   = {2026}
}

备注

preprint