中文

具有对称性与状态抽象时的策略梯度方法

机器学习 2024-03-08 v2 人工智能

摘要

在高维复杂问题上的强化学习(RL)依赖抽象以提升效率与泛化能力。本文研究连续控制设定下的抽象,并将马尔可夫决策过程(MDP)同态的定义推广到连续状态与动作空间的情形。我们推导了在抽象MDP上针对随机与确定性策略的策略梯度定理。我们的策略梯度结果允许利用环境的大致对称性进行策略优化。基于这些定理,我们提出一类演员-评论家算法,能够利用松弛互模拟度量同时学习策略与MDP同态映射。最后,我们引入一系列具有连续对称性的环境,以进一步展示我们的算法在此类对称性下进行动作抽象的能力。我们在自有环境以及DeepMind Control Suite中具挑战性的视觉控制任务上证明了方法的有效性。我们的方法利用MDP同态进行表示学习的能力带来了性能提升,且潜空间的可视化清晰展现了所学抽象的结构。

关键词

引用

@article{arxiv.2305.05666,
  title  = {Policy Gradient Methods in the Presence of Symmetries and State Abstractions},
  author = {Prakash Panangaden and Sahand Rezaei-Shoshtari and Rosie Zhao and David Meger and Doina Precup},
  journal= {arXiv preprint arXiv:2305.05666},
  year   = {2024}
}

备注

Published in the Journal of Machine Learning Research (JMLR). arXiv admin note: text overlap with arXiv:2209.07364