Grasper:面向追逃问题的通用追捕者
人工智能
2024-04-22 v1 计算机科学与博弈论
多智能体系统
摘要
追逃博弈(PEGs)对追捕者团队与逃逸者在基于图的环境(如城市街道网络)中的交互进行建模。近期进展表明,PSRO 中的预训练与微调范式在提升求解大规模 PEGs 的可扩展性方面是有效的。然而,这些方法主要聚焦于具有固定初始条件的特定 PEGs,而现实场景中初始条件可能变化极大,这显著阻碍了传统方法的适用性。为解决此问题,我们提出了 Grasper,一种面向追逃问题的通用追捕者,能够高效生成针对特定 PEGs 的追捕者策略。我们的贡献有三方面:首先,我们提出了一种新颖的架构,为多样化的 PEGs 提供高质量解,其关键组件包括: 图神经网络(GNN),将 PEGs 编码为隐向量; 超网络,基于这些隐向量生成追捕者策略。其次,我们开发了一种高效的三阶段训练方法,包括: 预预训练阶段,通过 GraphMAE 等自监督图学习技术学习鲁棒的 PEG 表示; 预训练阶段,利用启发式引导的多任务预训练(HMP),其中启发式导出的参考策略(如通过 Dijkstra 算法)对追捕者策略进行正则化; 微调阶段,采用 PSRO 在指定的 PEGs 上生成追捕者策略。最后,我们在合成地图与真实地图上进行了大量实验,展示了 Grasper 在解质量与泛化能力方面显著优于基线。我们证明,Grasper 为跨广泛场景的追逃问题提供了一种通用方法,使其能够在现实情境中实际部署。
引用
@article{arxiv.2404.12626,
title = {Grasper: A Generalist Pursuer for Pursuit-Evasion Problems},
author = {Pengdeng Li and Shuxin Li and Xinrun Wang and Jakub Cerny and Youzhi Zhang and Stephen McAleer and Hau Chan and Bo An},
journal= {arXiv preprint arXiv:2404.12626},
year = {2024}
}
备注
To appear in the 23rd International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2024)