判别器引导的基于模型的离线模仿学习
机器学习
2023-01-11 v3 人工智能
摘要
离线模仿学习(IL)是一种无需奖励标签、从专家示范中解决决策问题的有力方法。现有离线 IL 方法在专家数据有限时存在严重的性能退化。引入习得动力学模型有望提升专家数据的状态-动作空间覆盖,但也面临模型近似/泛化误差及滚动数据次优性等挑战。本文提出判别器引导的基于模型的离线模仿学习(DMIL)框架,引入判别器以同时区分模型滚动数据相对于真实专家示范的动力学正确性与次优性。DMIL 采用一种新颖的协作且对抗的学习策略,利用判别器引导并耦合策略与动力学模型的学习过程,从而提升模型性能与鲁棒性。我们的框架还可扩展至示范数据含大量次优数据的情形。实验结果表明,在小数据集下,DMIL 及其扩展相较最先进离线 IL 方法取得了更优的性能与鲁棒性。
引用
@article{arxiv.2207.00244,
title = {Discriminator-Guided Model-Based Offline Imitation Learning},
author = {Wenjia Zhang and Haoran Xu and Haoyi Niu and Peng Cheng and Ming Li and Heming Zhang and Guyue Zhou and Xianyuan Zhan},
journal= {arXiv preprint arXiv:2207.00244},
year = {2023}
}
备注
This work has been accepted by CoRL 2022