中文

R2PS:部分不可见性下的最差情况鲁棒实时追逐策略

机器学习 2026-05-15 v2

摘要

在追逃游戏(PEGs)中计算最差情况鲁棒策略 computation 耗时,尤其是在考虑实际因素如部分不可见性时。虽然对一般安全目的重要,但当前缺乏针对图基PEGs在追逐者仅有关于追逃者位置不完美信息情况下的实时适用追逐策略。虽然均衡策略泛化(EPG)和Grasper等最先进的强化学习(RL)方法为学习针对不同游戏动力学鲁棒的图神经网络(GNN)策略提供了指导,但它们局限于完美信息情景,不考虑追逃者可以预测追逐者动作的可能情况。本文引入首个在部分不可见性下的最差情况鲁棒实时追逐策略(R2PS)。我们首先证明,传统动态规划(DP)算法在追逃者进行异步移动的情况下保持最优性。随后,我们提出一种关于追逃者可能位置的信念保持机制,将DP追逐策略扩展到部分可见性设置。最后,我们将信念保持嵌入最先进的EPG框架,以完成我们的R2PS学习方案,这导致通过跨图强化学习获得的针对异步移动DP逃逸策略的实时追逐者策略。在强化学习之后,我们的策略对未知的真实世界图结构实现鲁棒的零样本泛化,并持续优于直接在测试图上训练的现有游戏RL方法。

关键词

引用

@article{arxiv.2511.17367,
  title  = {R2PS: Worst-Case Robust Real-Time Pursuit Strategies under Partial Observability},
  author = {Runyu Lu and Ruochuan Shi and Yuanheng Zhu and Dongbin Zhao},
  journal= {arXiv preprint arXiv:2511.17367},
  year   = {2026}
}