基于模型的强化学习中模型不变状态抽象
机器学习
2021-06-08 v2 人工智能
机器人学
摘要
动力学模型的准确性与泛化能力是基于模型的强化学习(MBRL)成功的关键。随着任务复杂度的增加,学习准确动力学模型的样本低效性也随之增加。然而,许多复杂任务在动力学上也表现出稀疏性,即动作对系统动力学仅具有局部影响。本文在单任务设定下从因果不变性视角利用该性质,引入一种称为模型不变性的新型状态抽象。与以往状态抽象形式不同,模型不变性状态抽象利用了状态变量上的因果稀疏性。这使得其对未见过状态的组合泛化成为可能,而这一点是非因子化状态抽象无法做到的。我们证明可在此模型不变性状态抽象上学习最优策略,并在简单玩具域中展示了改进的泛化能力。接着,我们提出一种实用方法以近似学习复杂域上的模型不变表示,并通过在诸如基于 MuJoCo 的 Humanoid 等挑战性任务上展示优于标准最大似然方法的建模性能来验证我们的方法。最后,在 MBRL 设定下,我们展示了在一系列其他连续控制任务中相对于样本效率的显著性能提升。
引用
@article{arxiv.2102.09850,
title = {Model-Invariant State Abstractions for Model-Based Reinforcement Learning},
author = {Manan Tomar and Amy Zhang and Roberto Calandra and Matthew E. Taylor and Joelle Pineau},
journal= {arXiv preprint arXiv:2102.09850},
year = {2021}
}