无需交互:基于神经常微分方程的鲁棒模型模仿学习
机器人学
2021-04-06 v1 机器学习
系统与控制
系统与控制
摘要
当前大多数模仿学习(IL)算法在训练过程中需要与环境或专家策略进行交互。对于无交互的 IL 问题,典型方法是行为克隆(BC)。然而,类 BC 方法往往受分布偏移影响。为缓解该问题,我们提出了一种鲁棒基于模型的模仿学习(RMBIL)框架,将模仿学习视为端到端可微的非线性闭环跟踪问题。RMBIL 应用神经常微分方程(Neural ODE)通过非线性动态逆(NDI)算法学习精确的多步动力学与鲁棒跟踪控制器。随后,学到的 NDI 控制器将与轨迹生成器(条件 VAE)结合以模仿专家行为。理论推导表明,当最小化 Neural ODE 的训练损失时,控制器网络可逼近一个 NDI。在 Mujoco 任务上的实验也表明,RMBIL 可与最先进的生成对抗方法(GAIL)相竞争,并在不平坦表面上比 BC 取得至少 30% 的性能提升。
引用
@article{arxiv.2104.01390,
title = {No Need for Interactions: Robust Model-Based Imitation Learning using Neural ODE},
author = {HaoChih Lin and Baopu Li and Xin Zhou and Jiankun Wang and Max Q. -H. Meng},
journal= {arXiv preprint arXiv:2104.01390},
year = {2021}
}