中文

基于去中心化共识推断的分层强化学习用于多约束无人机追逃游戏

人工智能 2025-06-24 v1

摘要

多个四旋翼无人机(UAV)系统已引起广泛研究兴趣,尤其是在多约束追逃游戏(MC-PEG)中。合作逃避与形成覆盖(CEFC)任务——即 UAV 群体试图在多个目标区域之间最大化形成覆盖,同时协作逃避捕食者——属于 MC-PEG 中最具挑战性的问题之一,尤其是在通信受限约束下。这种多层次问题交织了对障碍物、对手、目标区域和形成动力学的响应,导致在寻找解决方案时出现显著的高维复杂性。本文提出一种新型两层框架(即基于共识推断的分层强化学习,CI-HRL),将目标定位委托给高层策略,同时采用低层策略管理障碍规避、导航和形成。具体而言,在高层策略中,我们发展了一种新型多代理强化学习模块,Consensus-oriented Multi-Agent Communication(ConsMAC),以有效聚合邻居消息,使代理人能够感知全局信息并从局部状态建立共识。同时,我们利用基于替代训练的多代理近端策略优化(AT-M)和策略蒸馏完成低层控制。实验结果,包括高保真软件-在-循环(SITL)仿真,验证了 CI-HRL 提供了优越的解决方案,增强了群体的协作逃避和任务完成能力。

关键词

引用

@article{arxiv.2506.18126,
  title  = {Decentralized Consensus Inference-based Hierarchical Reinforcement Learning for Multi-Constrained UAV Pursuit-Evasion Game},
  author = {Xiang Yuming and Li Sizhao and Li Rongpeng and Zhao Zhifeng and Zhang Honggang},
  journal= {arXiv preprint arXiv:2506.18126},
  year   = {2025}
}