面向无监督基于模型强化学习的可预测 MDP 抽象
机器学习
2023-06-06 v2 人工智能
摘要
基于模型的强化学习(RL)的一个关键组成部分是预测动作结果的动力学模型。该预测模型中的误差会降低基于模型的控制器性能,而复杂的马尔可夫决策过程(MDPs)可能带来极其困难的预测问题。为缓解此问题,我们提出可预测 MDP 抽象(PMA):我们不在原始 MDP 上训练预测模型,而是在一个变换后的 MDP 上训练模型,该 MDP 具有学习得到的动作空间,仅允许可预测、易于建模的动作,同时尽可能覆盖原始状态-动作空间。因此,模型学习变得更简单且更准确,从而实现稳健、稳定的基于模型的规划或基于模型的 RL。该变换在用户指定任何任务之前以无监督方式学习。随后下游任务可通过基于模型的控制以零样本方式求解,无需额外的环境交互。我们从理论上分析了 PMA,并实证表明在一系列基准环境中,PMA 相较先前的无监督基于模型 RL 方法取得了显著改进。我们的代码和视频见 https://seohong.me/projects/pma/
引用
@article{arxiv.2302.03921,
title = {Predictable MDP Abstraction for Unsupervised Model-Based RL},
author = {Seohong Park and Sergey Levine},
journal= {arXiv preprint arXiv:2302.03921},
year = {2023}
}
备注
ICML 2023