面向无人机姿态控制的强化学习
机器人学
2018-04-13 v1
摘要
自动驾驶系统通常由提供稳定与控制的“内回路”和负责任务级目标(如航点导航)的“外回路”组成。无人机自动驾驶系统主要使用比例-积分-微分(PID)控制系统实现,其在稳定环境中表现出卓越性能。然而,在不可预测和恶劣环境中运行需要更复杂的控制。智能飞行控制系统是解决 PID 控制局限性的一个活跃研究领域,最近主要通过强化学习(RL)实现,RL 已在机器人等其他应用中取得成功。然而先前工作主要关注在任务级控制器中使用 RL。本工作中,我们研究了当使用最先进 RL 算法——深度确定性策略梯度(DDPG)、信赖域策略优化(TRPO)和近端策略优化(PPO)——训练的智能飞行控制系统时,提供姿态控制的内控制回路的性能与精度。为研究这些未知问题,我们首先开发了开源高保真仿真环境,通过 RL 训练四旋翼飞行控制器的姿态控制。随后利用该环境将其性能与 PID 控制器比较,以确定在高精度、时间关键飞行控制中使用 RL 是否合适。
引用
@article{arxiv.1804.04154,
title = {Reinforcement Learning for UAV Attitude Control},
author = {William Koch and Renato Mancuso and Richard West and Azer Bestavros},
journal= {arXiv preprint arXiv:1804.04154},
year = {2018}
}
备注
13 pages, 9 figures