中文

部分可观测环境下无 evader 依赖的团队式追逐策略

多智能体系统 2025-11-13 v1 机器人学

摘要

我们考虑一种场景:两架无人机 (UAV) 团队在城市环境中追逐 一个 evader UAV。每个 agent 都有有限的环境视野,建筑物可以遮挡其 field-of-view。此外,pursuer 团队对 evader 的初始位置、最终位置以及行为模式一无所知。因此,团队需要通过搜索环境来收集信息,然后跟踪它以最终拦截。为解决这个 multi-player、partially-observable、pursuit-evasion game,我们开发了一个以 bounded rationality 为原则的 two-phase neuro-symbolic algorithm。首先,我们采用深度强化学习制定一种 offline 方法,逐步训练针对虚构 evader 的 adversarial policies for pursuer 团队。这为每个 agent 在准备就绪后阶段的 online 阶段创建 kk levels of rationality。随后,我们采用 online classification algorithm 来确定我们当前对手从训练的 strategic agents 集合中进行 "best guess",并应用 best player response。使用这一 schema,我们在与 random evader 进行 our environment 中的 average performance 得到了改善。

关键词

引用

@article{arxiv.2511.05812,
  title  = {Evader-Agnostic Team-Based Pursuit Strategies in Partially-Observable Environments},
  author = {Addison Kalanther and Daniel Bostwick and Chinmay Maheshwari and Shankar Sastry},
  journal= {arXiv preprint arXiv:2511.05812},
  year   = {2025}
}