中文

强化学习算法中 Bellman 算子收敛性的增强

机器学习 2025-05-21 v1 人工智能

摘要

本文通过关注状态、动作和策略空间的结构,回顾了研究强化学习(RL)的拓扑基础。我们首先回顾了完备度量空间等关键数学概念,它们构成了表达 RL 问题的基础。通过利用 Banach 压缩原理,我们阐明了 Banach 不动点定理如何解释 RL 算法的收敛性,以及表示为 Banach 空间上算子的 Bellman 算子如何确保这种收敛。这项工作在理论数学与实际算法设计之间架起了一座桥梁,为提高 RL 的效率提供了新方法。特别地,我们研究了 Bellman 算子的替代表述,并展示了它们在 MountainCar、CartPole 和 Acrobot 等标准 RL 环境中对改善收敛速度和性能的影响。我们的发现突显了对 RL 更深入的数学理解如何能够为决策问题带来更有效的算法。

关键词

引用

@article{arxiv.2505.14564,
  title  = {Bellman operator convergence enhancements in reinforcement learning algorithms},
  author = {David Krame Kadurha and Domini Jocema Leko Moutouo and Yae Ulrich Gaba},
  journal= {arXiv preprint arXiv:2505.14564},
  year   = {2025}
}