连续 MDP 同态与同态策略梯度
机器学习
2022-09-16 v1
摘要
抽象化已被广泛研究作为提升强化学习算法效率与泛化能力的一种方式。本文中,我们研究连续控制设定下的抽象化。我们将 MDP 同态的定义推广到涵盖连续状态空间中的连续动作。我们推导了抽象 MDP 上的策略梯度定理,使得我们能够利用环境的大致对称性进行策略优化。基于该定理,我们提出了一种 actor-critic 算法,能够利用 lax bisimulation 度量同时学习策略与 MDP 同态映射。我们在 DeepMind Control Suite 的基准任务上展示了方法的有效性。我们的方法利用 MDP 同态进行表示学习的能力,使其在学习像素观测时取得更优性能。
引用
@article{arxiv.2209.07364,
title = {Continuous MDP Homomorphisms and Homomorphic Policy Gradient},
author = {Sahand Rezaei-Shoshtari and Rosie Zhao and Prakash Panangaden and David Meger and Doina Precup},
journal= {arXiv preprint arXiv:2209.07364},
year = {2022}
}
备注
NeurIPS 2022