中文

基于路径引导的MAPPO与方向前沿分配实现对密集环境中协同搜索捕获的通用化

机器人学 2025-12-11 v1 机器学习 多智能体系统

摘要

在密集环境中进行协同搜捕存在显著挑战,主要由于稀疏奖励和受限视场(FOV)。标准的多智能体强化学习(MARL)常因探索不够高效且难以扩展到大规模场景。我们提出PGF-MAPPO(Path-Guided Frontier MAPPO),一种层次化框架,将拓扑规划与反应控制相结合。为解决局部最小化和稀疏奖励问题,我们集成了基于A*的势场,以实现密集奖励塑形。此外,我们引入方向前沿分配(Directional Frontier Allocation),结合最远点采样(FPS)和几何角度抑制,以实现空间分散和加速覆盖。该架构采用参数共享的去中心化评论家,保持O(1)的模型复杂度,适用于机器人群体。实验表明,PGF-MAPPO在面对更快的逃脱者时实现了优越的捕获效率。训练于10x10地图上的策略在未见的20x20环境中实现了稳健的零样本泛化,显著优于基于规则和基于学习的基线方法。

关键词

引用

@article{arxiv.2512.09410,
  title  = {Generalizable Collaborative Search-and-Capture in Cluttered Environments via Path-Guided MAPPO and Directional Frontier Allocation},
  author = {Jialin Ying and Zhihao Li and Zicheng Dong and Guohua Wu and Yihuan Liao},
  journal= {arXiv preprint arXiv:2512.09410},
  year   = {2025}
}

备注

7 pages, 7 figures