中文

强化学习的庞特莱奇视角

机器学习 2025-04-23 v3 最优化与控制

摘要

强化学习传统上专注于学习基于状态的策略,以闭环方式解决最优控制问题。本文引入了开环强化学习范式,其中学习固定的动作序列。我们提出了三个新算法:一个稳健的基于模型的方法和两个高效的无模型方法。我们的算法基于动态规划中的 Bellman 方程,而非开环最优控制理论中的庞特莱奇原理。我们提供了收敛保证,并在摆 Pendulum 任务以及两个高维 MuJoCo 任务上对所有方法进行了实证评估,显著优于现有基线方法。

关键词

引用

@article{arxiv.2405.18100,
  title  = {A Pontryagin Perspective on Reinforcement Learning},
  author = {Onno Eberhard and Claire Vernade and Michael Muehlebach},
  journal= {arXiv preprint arXiv:2405.18100},
  year   = {2025}
}