中文

基于深度强化学习的未知环境下多UAV野蛮-逼捕在线规划

机器人学 2025-09-09 v2 人工智能 计算与语言

摘要

多UAV 野蛮-逼捕问题(即追逐者试图捕获逃避者)是无人机群体智能的关键挑战。多智能体强化学习(MARL)在建模合作行为方面显示出潜力,但大多数基于强化学习的方法仍受限于简化仿真环境,缺乏动态或固定情景。以往尝试将强化学习策略部署到真实野蛮-逼捕场景的工作,主要局限于二维场景,如地面车辆或固定高度的无人机。本文针对多UAV 野蛮-逼捕问题,考虑了无人机的动力学与物理约束。我们引入逃避者预测增强网络,以解决合作策略学习中的部分可观测性问题。此外,提出一种自适应环境生成器,融入 MARL 训练中,以提高探索效率并提升策略在多样化情景下的泛化能力。仿真结果表明,本方法在具有挑战性的情景中显著优于所有基线方法,能以 100% 捕获率泛化至未见情景。最后,我们通过两阶段奖励细化得到可行策略,并以零样本方式在真实四旋翼机上进行部署。我们的方法是首个针对未知环境下多UAV 野蛮-逼捕,基于集体推力和机体速率控制指令的强化学习策略。开源代码与视频已公开:https://sites.google.com/view/pursuit-evasion-rl。

关键词

引用

@article{arxiv.2409.15865,
  title  = {BeSimulator: A Large Language Model Powered Text-based Behavior Simulator},
  author = {Jianan Wang and Bin Li and Jingtao Qi and Xueying Wang and Fu Li and Hanxun Li},
  journal= {arXiv preprint arXiv:2409.15865},
  year   = {2025}
}

备注

19 pages, 5 figures, 8 tables