基于近端策略优化的固定翼无人机深度强化学习姿态控制
机器人学
2019-11-14 v1 系统与控制
系统与控制
摘要
与经验丰富的飞行员相比,当代无人机(UAV)自动驾驶系统在飞行包线上受到很大限制,从而制约了无人机可自主运行的条件及其可完成的任务类型。本文提出一种深度强化学习(DRL)控制器来处理非线性姿态控制问题,从而扩展固定翼无人机的飞行包线。我们开发了使用近端策略优化(PPO)算法的概念验证控制器,并证明其能够将固定翼无人机从大量初始条件稳定至参考滚转、俯仰和空速值。本文概述了训练过程并考虑了影响其进展速率的关键因素,发现最重要的因素是限制观测向量中的变量数量,并为这些变量包含若干先前时间步的数值。将训练后的强化学习(RL)控制器与比例-积分-微分(PID)控制器进行比较,发现其在更多情况下能够收敛,且性能相当。此外,即使在严重扰动条件下,RL控制器对风和湍流形式的未知扰动也表现出良好的泛化能力。
引用
@article{arxiv.1911.05478,
title = {Deep Reinforcement Learning Attitude Control of Fixed-Wing UAVs Using Proximal Policy Optimization},
author = {Eivind Bøhn and Erlend M. Coates and Signe Moe and Tor Arne Johansen},
journal= {arXiv preprint arXiv:1911.05478},
year = {2019}
}
备注
11 pages, 3 figures, 2019 International Conference on Unmanned Aircraft Systems (ICUAS)