中文

面向无监督基于模型强化学习的可预测 MDP 抽象

机器学习 2023-06-06 v2 人工智能

摘要

基于模型的强化学习(RL)的一个关键组成部分是预测动作结果的动力学模型。该预测模型中的误差会降低基于模型的控制器性能,而复杂的马尔可夫决策过程(MDPs)可能带来极其困难的预测问题。为缓解此问题,我们提出可预测 MDP 抽象(PMA):我们不在原始 MDP 上训练预测模型,而是在一个变换后的 MDP 上训练模型,该 MDP 具有学习得到的动作空间,仅允许可预测、易于建模的动作,同时尽可能覆盖原始状态-动作空间。因此,模型学习变得更简单且更准确,从而实现稳健、稳定的基于模型的规划或基于模型的 RL。该变换在用户指定任何任务之前以无监督方式学习。随后下游任务可通过基于模型的控制以零样本方式求解,无需额外的环境交互。我们从理论上分析了 PMA,并实证表明在一系列基准环境中,PMA 相较先前的无监督基于模型 RL 方法取得了显著改进。我们的代码和视频见 https://seohong.me/projects/pma/

关键词

引用

@article{arxiv.2302.03921,
  title  = {Predictable MDP Abstraction for Unsupervised Model-Based RL},
  author = {Seohong Park and Sergey Levine},
  journal= {arXiv preprint arXiv:2302.03921},
  year   = {2023}
}

备注

ICML 2023