利用管MPC引导数据增强高效深度学习鲁棒自适应策略
机器人学
2023-10-03 v2 人工智能
摘要
在极具挑战性的非结构化环境中部署敏捷自主系统需要具备适应能力和对不确定性的鲁棒性。现有的鲁棒与自适应控制器,如基于模型预测控制(MPC)的控制器,虽能以繁重的在线机载计算为代价取得令人印象深刻的性能。从MPC高效学习鲁棒且可机载部署策略的方法已然涌现,但仍缺乏基本的适应能力。本工作中,我们扩展了一种现有的高效模仿学习(IL)算法,用于从MPC中进行鲁棒策略学习,使其具备学习适应严峻模型/环境不确定性策略的能力。我们方法的核心思想在于:通过以可在线高效估计的所学低维模型/环境表征为策略条件,修改IL过程。我们将该方法定制于学习任务:在多旋翼上学习自适应位置与姿态控制策略,以在严峻扰动下跟踪轨迹。仿真评估表明,约小时内即可获得高质量自适应策略。我们进一步从经验上展示了针对训练分布内与分布外不确定性的快速适应,在对应于约机器人重量且比训练中所见最大风速大的风扰下,实现了 cm平均位置误差。
引用
@article{arxiv.2303.15688,
title = {Efficient Deep Learning of Robust, Adaptive Policies using Tube MPC-Guided Data Augmentation},
author = {Tong Zhao and Andrea Tagliabue and Jonathan P. How},
journal= {arXiv preprint arXiv:2303.15688},
year = {2023}
}
备注
8 pages, 6 figures. IROS23 final version, with page numbers added