面向无人机安全目标导航的多追逃博弈学习
机器人学
2024-02-22 v2 人工智能
摘要
在存在来自多个追捕者的对抗性物理攻击的情况下,无人机的安全导航是一项具有挑战性的任务。本文提出了一种新颖的方法,即异步多阶段深度强化学习(AMS-DRL),以训练对抗性神经网络,这些网络可以从多个进化的追捕者的行为中学习并快速适应其行为,使无人机能够躲避攻击并到达其目标。具体而言,AMS-DRL在追逃博弈中进化对抗性智能体,其中追捕者和逃跑者在多个阶段以二部图的方式异步训练。通过博弈论分析,我们的方法保证了智能体之间的Nash均衡,从而确保收敛。我们在广泛的模拟中评估了我们的方法,并表明它以更高的导航成功率优于基线。我们还分析了相对最大速度等参数如何影响导航性能。此外,我们进行了物理实验,并验证了训练策略在实时飞行中的有效性。引入了成功率热图,以阐明空间几何如何影响导航结果。项目网站:https://github.com/NTU-ICG/AMS-DRL-for-Pursuit-Evasion。
引用
@article{arxiv.2304.03443,
title = {Learning Multi-Pursuit Evasion for Safe Targeted Navigation of Drones},
author = {Jiaping Xiao and Mir Feroskhan},
journal= {arXiv preprint arXiv:2304.03443},
year = {2024}
}
备注
Accepted by IEEE Transactions on Artificial Intelligence