追逐金色飞贼:基于多智能体强化学习的多无人机时间最优运动规划
机器人学
2025-03-06 v2 机器学习
摘要
自主无人机的最新创新通过应用最优控制与基于学习的方法,实现了单无人机配置下的时间最优飞行,并增强了多无人机系统的机动性。然而,鲜有研究在高度敏捷的机动或动态场景中实现多无人机系统的时间最优运动规划。本文提出一种基于多智能体强化学习的去中心化策略网络,用于时间最优的多无人机飞行。为在飞行效率与碰撞避免之间取得平衡,我们引入了一种受基于优化方法启发的软无碰撞机制。通过以集中训练、去中心化执行 (CTDE) 的方式定制 PPO,我们在确保轻量化实现的同时,解锁了训练中更高的效率与稳定性。大量仿真表明,尽管与单无人机系统相比存在轻微的性能折中,我们的多无人机方法仍保持了接近时间最优的性能,且碰撞率较低。真实世界实验验证了我们的方法,两架四旋翼无人机使用与仿真中相同的网络,在 5.5 m * 5.5 m * 2.0 m 空间内的各种赛道上,完全依赖机载计算实现了 13.65 m/s 的最大速度与 13.4 rad/s 的最大机体角速率。
引用
@article{arxiv.2409.16720,
title = {Dashing for the Golden Snitch: Multi-Drone Time-Optimal Motion Planning with Multi-Agent Reinforcement Learning},
author = {Xian Wang and Jin Zhou and Yuanli Feng and Jiahao Mei and Jiming Chen and Shuo Li},
journal= {arXiv preprint arXiv:2409.16720},
year = {2025}
}
备注
v2: 7 pages, 6 figures; terminology corrected, algorithmic and equation descriptions revised, references added