基于深度强化学习的自主无人机长期规划
机器学习
2020-07-14 v1 人工智能
信息论
math.IT
机器学习
摘要
本文研究一种基于现实无人机竞速比赛的长期规划场景。我们在为 NeurIPS 2019 的“无人机游戏:无人机竞速比赛”所创建的框架上进行实验。竞速环境使用微软的 AirSim Drone Racing Lab 构建。一个强化学习智能体(本例中为模拟四旋翼)采用近端策略优化(PPO)算法训练,能够成功对抗另一个运行经典路径规划算法的模拟四旋翼。智能体观测包含来自 IMU 传感器的数据、通过仿真获得的无人机 GPS 坐标以及对手无人机 GPS 信息。训练中使用对手无人机 GPS 信息有助于处理复杂状态空间,作为专家引导可实现高效稳定的训练过程。本文所有实验均可在我们的 GitHub 仓库中以代码复现。
引用
@article{arxiv.2007.05694,
title = {Long-Term Planning with Deep Reinforcement Learning on Autonomous Drones},
author = {Ugurkan Ates},
journal= {arXiv preprint arXiv:2007.05694},
year = {2020}
}
备注
Submitted to Association for the Advancement of Artificial Intelligence(AAAI) 2020 Fall Symposium Series