中文

连续状态与动作空间中神经强化学习的几何结构

机器学习 2025-07-29 v1 人工智能

摘要

强化学习(RL)的进展使其能够成功应用于连续状态与动作空间的复杂任务。尽管在实际应用中取得了显著进展,但大多数理论工作仍针对有限状态与动作空间。我们提出通过几何视角来理解连续状态与动作空间中局部可达状态集合的结构。通过半梯度方法学习的各参数化策略集合,诱导出RL中的可达状态集合。我们表明,二维神经策略的训练动力学在基于演员-评论家算法训练的高维正规状态空间中,诱导出一个低维可达状态流形。我们证明,在某些条件下,该流形的维度与动作空间的维度呈同阶。这类首次将状态空间几何与动作空间维度关联的研究成果,首次提出。我们在四个 MuJoCo 环境中进行实验验证,并在具有可变维度的 toy 环境中展示了该上界。我们还通过在策略和价值函数网络中引入局部流形学习层,改变神经网络的一个层以学习稀疏表示,从而在高自由度控制环境中提升性能。

关键词

引用

@article{arxiv.2507.20853,
  title  = {Geometry of Neural Reinforcement Learning in Continuous State and Action Spaces},
  author = {Saket Tiwari and Omer Gottesman and George Konidaris},
  journal= {arXiv preprint arXiv:2507.20853},
  year   = {2025}
}

备注

Proceedings of the Thirteenth International Conference on Learning Representations (ICLR 2025). arXiv admin note: text overlap with arXiv:2301.00009