基于贝尔曼方程的强化学习中的理论障碍
机器学习
2025-02-18 v1 人工智能
摘要
针对高维空间设计的强化学习算法通常对状态采样子集施加贝尔曼方程,依赖泛化来在状态空间中传播知识。本文识别并形式化了这一常见方法的根本局限。具体而言,我们构造了具有简单结构的反例问题,该方法无法有效利用这些结构。我们的发现揭示了此类算法可能忽略问题的关键信息,导致效率低下。此外,我们将这一负面结果推广到文献中的另一种方法——事后经验回放学习状态到状态的可达性。
引用
@article{arxiv.2502.11968,
title = {Theoretical Barriers in Bellman-Based Reinforcement Learning},
author = {Brieuc Pinon and Raphaël Jungers and Jean-Charles Delvenne},
journal= {arXiv preprint arXiv:2502.11968},
year = {2025}
}