基于强化学习的多无人机编队控制与静态和动态障碍物规避
机器人学
2025-03-04 v2
摘要
本文解决了在定向飞行中多架无人机(UAV)保持编队同时规避静态和动态障碍物的挑战性任务。该任务的复杂性源于其多目标性质、巨大的探索空间以及仿真到现实的差距。为应对这些挑战,我们提出了一种两阶段强化学习(RL)流程。在第一阶段,我们随机搜索一个奖励函数,以平衡关键目标:定向飞行、障碍物规避、编队保持和零样本策略部署。第二阶段将此奖励函数应用于更复杂的场景,并利用课程学习加速策略训练。此外,我们引入了一个基于注意力的观测编码器,以改善编队保持和对不同障碍物密度的适应性。在仿真和真实环境中的实验结果表明,在静态、动态和混合障碍物场景中,我们的方法在无碰撞率和编队保持方面均优于基于规划和基于RL的基线方法。消融研究进一步证实了我们的课程学习策略和基于注意力的编码器的有效性。动画演示可在以下网址获取:https://sites.google.com/view/uav-formation-with-avoidance/。
引用
@article{arxiv.2410.18495,
title = {Multi-UAV Formation Control with Static and Dynamic Obstacle Avoidance via Reinforcement Learning},
author = {Yuqing Xie and Chao Yu and Hongzhi Zang and Feng Gao and Wenhao Tang and Jingyi Huang and Jiayu Chen and Botian Xu and Yi Wu and Yu Wang},
journal= {arXiv preprint arXiv:2410.18495},
year = {2025}
}