基于鲁棒管道 MPC 模仿的示范高效引导策略搜索
机器人学
2021-09-27 v2 机器学习
摘要
我们提出一种示范高效策略,将计算昂贵的模型预测控制器(MPC)压缩为基于深度神经网络和模仿学习(IL)的更高计算效率表示。通过生成 MPC 的鲁棒管道变体(RTMPC)并利用管道的性质,我们引入了一种数据增强方法,能够实现高示范效率,并可补偿 IL 中典型遇到的分布偏移。我们的方法开启了从在标称域(如仿真或实验室/受控环境中的机器人)收集的单个示范零样本迁移到具有有界模型误差/扰动的域的可能性。在四旋翼轨迹跟踪 MPC 上进行的数值与实验评估表明,我们的方法在示范效率和对训练期间未见扰动的鲁棒性方面优于 IL 中常用策略,如 DAgger 和域随机化。
引用
@article{arxiv.2109.09910,
title = {Demonstration-Efficient Guided Policy Search via Imitation of Robust Tube MPC},
author = {Andrea Tagliabue and Dong-Ki Kim and Michael Everett and Jonathan P. How},
journal= {arXiv preprint arXiv:2109.09910},
year = {2021}
}
备注
Submitted to the 2022 IEEE Conference on Robotics and Automation (ICRA). Video: https://youtu.be/28zQFktJIqg