基于模型的利用模型与策略熵正则化的模仿学习
机器学习
2022-09-01 v2 人工智能
摘要
基于生成对抗网络的模仿学习方法前景广阔,因其在专家示范方面样本高效。然而,训练生成器需要与真实环境大量交互,因为采用无模型强化学习来更新策略。为利用基于模型的强化学习提升样本效率,我们在熵正则化马尔可夫决策过程下提出基于模型的熵正则化模仿学习(MB-ERIL),以减少与真实环境的交互次数。MB-ERIL使用两个判别器。策略判别器区分机器人生成的动作与专家动作,模型判别器区分模型生成的反事实状态转移与真实状态转移。我们推导出结构化判别器,以使策略与模型的学习高效。计算机仿真与真实机器人实验表明,与基线方法相比,MB-ERIL取得了有竞争力的性能并显著提升了样本效率。
引用
@article{arxiv.2206.10101,
title = {Model-Based Imitation Learning Using Entropy Regularization of Model and Policy},
author = {Eiji Uchibe},
journal= {arXiv preprint arXiv:2206.10101},
year = {2022}
}
备注
This is a preprint version of the paper to appear at IEEE Robotics and Automation Letters (RA-L). The final journal version is downloadable from https://doi.org/10.1109/LRA.2022.3196139