基于 MPC 引导策略搜索的自主飞行器深度控制策略学习
机器学习
2016-02-17 v2 机器人学
摘要
模型预测控制(MPC)是控制机器人系统尤其是诸如四旋翼等自主飞行器的有效方法。然而,MPC 的应用可能计算量大,且通常需要估计系统状态,这在复杂非结构化环境中具有挑战性。强化学习原则上可免去显式状态估计的需要,并获得直接将传感器读数映射为动作的策略,但难以应用于不稳定系统,因为在找到有效策略前训练过程中容易发生灾难性失败。我们提出在引导策略搜索框架下将 MPC 与强化学习结合,其中 MPC 用于在仪器化训练环境提供的全状态观测下于训练时生成数据。该数据用于训练深度神经网络策略,该策略仅允许访问载具机载传感器的原始观测。训练后,神经网络策略可在不知全状态的情况下成功控制机器人,且计算成本仅为 MPC 的一小部分。我们通过为模拟四旋翼学习避障策略来评估我们的方法,使用模拟机载传感器且在测试时无显式状态估计。
引用
@article{arxiv.1509.06791,
title = {Learning Deep Control Policies for Autonomous Aerial Vehicles with MPC-Guided Policy Search},
author = {Tianhao Zhang and Gregory Kahn and Sergey Levine and Pieter Abbeel},
journal= {arXiv preprint arXiv:1509.06791},
year = {2016}
}