中文

无人机控制任务中的强化学习奖励函数

机器人学 2022-07-20 v1 机器学习 神经与进化计算

摘要

本文提出了一种可用于无人机(UAV)控制与导航问题中深度强化学习的新型奖励函数。该奖励函数基于简化目标轨迹(即三阶贝塞尔曲线)的构建与时间估计。该奖励函数可不经修改地应用于二维和三维虚拟环境中解决问题。奖励函数的有效性在一个新开发的虚拟环境中进行了测试,即一个描述无人机控制与飞行动力学的简化二维环境,其中考虑了推力、惯性、重力和空气阻力的作用。在此表述下,成功解决了三个无人机控制与导航任务:无人机飞向空间给定点、规避另一无人机拦截、以及组织一架无人机对另一架无人机的拦截。使用了三种最相关的现代深度强化学习算法:Soft actor-critic、Deep Deterministic Policy Gradient和Twin Delayed Deep Deterministic Policy Gradient。三种算法均表现良好,表明所选奖励函数的有效性。

关键词

引用

@article{arxiv.2203.10519,
  title  = {Reinforcement learning reward function in unmanned aerial vehicle control tasks},
  author = {Mikhail S. Tovarnov and Nikita V. Bykov},
  journal= {arXiv preprint arXiv:2203.10519},
  year   = {2022}
}