连续状态与动作空间中强化学习的几何视角
机器学习
2024-08-13 v2 人工智能
摘要
强化学习的进展已使其成功应用于具有连续状态与动作空间的复杂任务。尽管在实践中取得了这些进展,大多数理论工作仍局限于有限状态与动作空间。我们提出通过几何视角构建对连续状态与动作空间的理论理解。我们工作的核心思想是:转移动态在高维名义状态空间中诱导出一个可达状态的低维流形。我们证明,在特定条件下,该流形的维度至多为动作空间维度加一。这是此类首个结果,将状态空间的几何与动作空间的维度联系起来。我们在四个 MuJoCo 环境中从经验上证实了该上界。我们进一步通过在低维表示中学习策略来展示我们结果的适用性。为此,我们引入了一种算法,利用 DDPG 将到低维表示的映射(作为深度神经网络的一个窄隐藏层)与策略联合学习。我们的实验表明,以这种方式学习的策略在四个 MuJoCo 控制套件任务上表现相当或更好。
引用
@article{arxiv.2301.00009,
title = {On the Geometry of Reinforcement Learning in Continuous State and Action Spaces},
author = {Saket Tiwari and Omer Gottesman and George Konidaris},
journal= {arXiv preprint arXiv:2301.00009},
year = {2024}
}
备注
We found an issue with one of the proofs. We are working on rectifying it