中文

关于使用探测策略识别 Swarm Leader

机器人学 2025-12-23 v1 人工智能 多智能体系统

摘要

在对抗性情境中识别群体领袖至关重要,尤其是当领袖需要隐藏以确保任务成功时。本工作引入交互式 Swarm Leader Identification (iSLI) 问题,这是一种新方法,其中对抗性探测代理通过物理与成员交互来识别群体的领袖。我们将 iSLI 问题建模为部分可观测马尔可夫决策过程 (POMDP),并采用深度强化学习,具体为近端策略优化 (PPO),训练探测器的策略。该方法利用一种新型神经网络架构,集成 Timed Graph Relationformer (TGR) 层和简化结构化状态空间序列 (S5) 模型。TGR 层有效处理基于图的观察,捕获时序依赖性并通过学习的门控机制融合关系信息,为策略学习生成信息丰富的表示。大量仿真实验表明,我们的 TGR 基于模型优于基线图神经网络架构,在各种群体规模和速度上展现出显著的零样本泛化能力,这些规模和速度与训练期间的不同。训练好的探测器在识别领袖方面取得高准确率,即使在超出训练分布的场景中也能保持性能,并显示出对其预测具有恰当置信水平。实际机器人实验进一步验证了该方法,确认了从仿真到现实的成功迁移以及对动态变化的鲁棒性,如意外代理断开连接。

关键词

引用

@article{arxiv.2512.18146,
  title  = {On Swarm Leader Identification using Probing Policies},
  author = {Stergios E. Bachoumas and Panagiotis Artemiadis},
  journal= {arXiv preprint arXiv:2512.18146},
  year   = {2025}
}

备注

13 pages, journal