对抗式选项感知分层模仿学习
机器学习
2021-06-14 v2 机器人学
摘要
从长视野未标注示范中学习智能体技能一直是一项挑战。现有方法如分层模仿学习(HIL)容易出现复合误差或次优解。在本文中,我们提出Option-GAIL,一种从长视野学习技能的新方法。Option-GAIL的关键思想是通过选项(options)对任务层次进行建模,并通过生成对抗优化训练策略。具体而言,我们提出一种期望最大化(EM)式算法:E步基于当前所学策略对专家的选项进行采样,M步同时更新智能体的低层与高层策略,以最小化新提出的专家与智能体之间的选项占据度量。我们从理论上证明了所提算法的收敛性。实验表明,Option-GAIL在多种任务上始终优于其他同类方法。
引用
@article{arxiv.2106.05530,
title = {Adversarial Option-Aware Hierarchical Imitation Learning},
author = {Mingxuan Jing and Wenbing Huang and Fuchun Sun and Xiaojian Ma and Tao Kong and Chuang Gan and Lei Li},
journal= {arXiv preprint arXiv:2106.05530},
year = {2021}
}
备注
accepted by ICML 2021