GAN-MPC:利用非相同专家示范与参数化代价函数训练模型预测控制器
机器人学
2023-06-08 v2 人工智能
机器学习
摘要
模型预测控制(MPC)是实际机器人应用中轨迹优化的一种流行方法。MPC策略可在运动动力学与安全约束下优化轨迹参数,并对安全性、最优性、可泛化性、可解释性与可说明性提供保证。然而,某些行为十分复杂,难以手工设计MPC目标函数。一类称为可学习MPC(Learnable-MPC)的特殊MPC策略利用专家示范的模仿学习解决了这一困难。然而,它们要求示范者与模仿者智能体完全相同,这在许多机器人实际应用领域中难以满足。本文研究示范者与模仿者不具有相同动力学且状态空间仅部分重叠时训练可学习MPC策略的实际问题。我们提出一种新方法,利用生成对抗网络(GAN)最小化示范者与模仿者状态-轨迹分布之间的Jensen-Shannon散度。我们在DeepMind Control套件的多种模拟机器人任务上评估了该方法,并证明了我们的方法在学习示范者行为时无需复制其动作的有效性。
引用
@article{arxiv.2305.19111,
title = {GAN-MPC: Training Model Predictive Controllers with Parameterized Cost Functions using Demonstrations from Non-identical Experts},
author = {Returaj Burnwal and Anirban Santara and Nirav P. Bhatt and Balaraman Ravindran and Gaurav Aggarwal},
journal= {arXiv preprint arXiv:2305.19111},
year = {2023}
}
备注
Recipient of the best paper award at RBCDSAI-DAI 2023, IIT Madras (https://rbcdsai.iitm.ac.in/DAI-2023/)