规划目标并学习技能:基于解耦策略迁移的可迁移仅状态模仿学习
机器学习
2022-10-03 v5 人工智能
摘要
近期仅状态模仿学习的进展通过免除对专家动作的观测需求,扩展了模仿学习在真实世界环境中的适用范围。然而,现有方案仅从数据中学习提取状态到动作的映射策略,而未考虑专家如何规划至目标。这阻碍了对演示的利用并限制了策略的灵活性。本文引入解耦策略优化(Decoupled Policy Optimization, DePO),其显式地将策略解耦为一个高层状态规划器和一个逆动力学模型。通过嵌入解耦策略梯度和生成对抗训练,DePO 实现了向不同动作空间或状态转移动力的知识迁移,并可将规划器泛化至演示外的状态区域。我们的深入实验分析显示了 DePO 在学习泛化目标状态规划器的同时取得最佳模仿性能的有效性。我们展示了 DePO 通过预训练跨任务迁移的吸引人用途,以及用于具有多种技能的智能体协同训练的潜力。
引用
@article{arxiv.2203.02214,
title = {Plan Your Target and Learn Your Skills: Transferable State-Only Imitation Learning via Decoupled Policy Optimization},
author = {Minghuan Liu and Zhengbang Zhu and Yuzheng Zhuang and Weinan Zhang and Jianye Hao and Yong Yu and Jun Wang},
journal= {arXiv preprint arXiv:2203.02214},
year = {2022}
}
备注
22 pages, 3 tables, 17 figures. Published at ICML 2022. Project page and code at https://decoupled-policy-optimization.github.io/