中文

样本平均Q学习的渐近分析

机器学习 2025-02-28 v2 信息论 math.IT 机器学习

摘要

强化学习(RL)已成为在复杂和不确定环境中训练智能体的关键方法。在 RL 算法中融入统计推断对于理解和管理模型性能中的不确定性至关重要。本文提出了一个时变批量平均 Q 学习的通用框架,称为样本平均 Q 学习(SA-QL),它通过聚合奖励和下一状态的样本来更好地考虑数据变异性和不确定性,从而扩展了传统的单样本 Q 学习。我们利用函数中心极限定理(FCLT)建立了一个新颖的框架,该框架在温和条件下提供了对样本平均算法渐近正态性的见解。此外,我们开发了一种用于区间估计的随机缩放方法,使得无需额外超参数即可构建置信区间。在经典随机 OpenAI Gym 环境(包括 windy gridworld 和 slippery frozenlake)上进行的大量数值实验,展示了不同的批次调度策略如何影响学习效率、覆盖率和置信区间宽度。这项工作为样本平均 Q 学习建立了统一的理论基础,为 RL 算法的有效批次调度和统计推断提供了见解。

关键词

引用

@article{arxiv.2410.10737,
  title  = {Asymptotic Analysis of Sample-averaged Q-learning},
  author = {Saunak Kumar Panda and Ruiqi Liu and Yisha Xiang},
  journal= {arXiv preprint arXiv:2410.10737},
  year   = {2025}
}