中文

面向对抗模仿学习的隐空间策略

机器学习 2022-06-24 v1 机器人学

摘要

本文考虑从专家示范中学习机器人运动与操作任务。生成对抗模仿学习 (GAIL) 训练一个判别器以区分专家与智能体转移,并转而利用判别器输出定义的奖励来优化智能体的策略生成器。这种生成对抗训练方法非常强大,但依赖于判别器与生成器训练之间的微妙平衡。在高维问题中,判别器训练可能轻易过拟合或利用与任务无关特征的关联进行转移分类。本工作的一个关键洞见是:在合适的隐任务空间中执行模仿学习可使训练过程稳定,即便在困难的高维问题中亦然。我们使用动作编码器-解码器模型获得低维隐动作空间,并训练使用对抗模仿学习的隐空间策略 (LAPAL)。该编码器-解码器模型可离线从状态-动作对训练以获得任务无关的隐动作表示,或在线与判别器和生成器训练同时进行以获得任务相关的隐动作表示。我们证明 LAPAL 训练稳定,具有近单调的性能提升,并在大多数运动与操作任务中达到专家性能,而 GAIL 基线收敛更慢且在高维环境中未达到专家性能。

关键词

引用

@article{arxiv.2206.11299,
  title  = {Latent Policies for Adversarial Imitation Learning},
  author = {Tianyu Wang and Nikhil Karnwal and Nikolay Atanasov},
  journal= {arXiv preprint arXiv:2206.11299},
  year   = {2022}
}

备注

8 pages, 5 figures