基于模仿学习与管道引导数据增强从 MPC 高效学习鲁棒策略
机器人学
2024-07-09 v2
摘要
模仿学习(IL)能够从模型预测控制(MPC)提供的演示中生成计算高效的策略。然而,IL 方法通常需要大量的数据收集与训练工作,若任务改变则策略难以调整,并且所生成的策略对新扰动的鲁棒性有限。在本工作中,我们提出一种 IL 策略,用于将一个计算昂贵的 MPC 高效压缩为一个对先前未见的扰动具有鲁棒性的深度神经网络策略。通过使用一种称为鲁棒管道 MPC(Robust Tube MPC)的 MPC 鲁棒变体,并利用该控制器的性质,我们引入了计算高效的数据增强方法,能够显著减少生成鲁棒策略所需的 MPC 演示数量与训练工作量。我们的方法开启了这样一种可能:将在标称域(如仿真或实验室/受控环境中的机器人)中从单次 MPC 演示训练得到的策略,零样本迁移到具有先前未见的有限界模型误差/扰动的新域中。使用多旋翼敏捷飞行的线性与非线性 MPC 进行的数值评估表明,我们的方法在演示效率、训练时间以及对训练期间未见的扰动的鲁棒性方面,优于 IL 中常用的方法(如数据集聚合(DAgger)与域随机化(DR))。实验评估验证了该方法的效率与真实世界鲁棒性。
引用
@article{arxiv.2306.00286,
title = {Efficient Deep Learning of Robust Policies from MPC using Imitation and Tube-Guided Data Augmentation},
author = {Andrea Tagliabue and Jonathan P. How},
journal= {arXiv preprint arXiv:2306.00286},
year = {2024}
}
备注
Accepted for the Transaction on Robotics (T-RO), May 2024