中文

不确定环境下大规模多智能体系统的平均场博弈与分散式智能自适应追逃策略

系统与控制 2020-08-10 v1 系统与控制

摘要

本文提出了一种新颖的分散式智能自适应最优策略,用于解决不确定环境下大规模多智能体系统(MAS)的追逃博弈。现有追逃博弈策略由于 notorious 的“维数灾难”和通信限制,在智能体数量庞大时既低效又不实用。为克服这些挑战,本文采用新兴的平均场博弈理论,并将其与强化学习进一步结合,开发了一种新颖的分散式智能自适应策略,其具有一种新型自适应动态规划架构,称为 Actor-Critic-Mass(ACM)。通过在线逼近耦合平均场方程的解,所开发的策略即使对于不确定环境下的大规模 MAS 也能获得最优追逃策略。在所提出的基于 ACM 学习的策略中,每个智能体维护五个神经网络:1)评论家神经网络,用于逼近每个个体智能体的 HJI 方程解;2)群体神经网络,用于估计群体的群体密度函数(即 mass);3)行动者神经网络,用于逼近分散式最优策略;4)另外两个神经网络用于估计对手群体 mass 以及最优代价函数。最后,提供了综合数值仿真以证明所设计策略的有效性。

关键词

引用

@article{arxiv.2008.02940,
  title  = {Mean Field Game and Decentralized Intelligent Adaptive Pursuit Evasion Strategy for Massive Multi-Agent System under Uncertain Environment},
  author = {Zejian Zhou and Hao Xu},
  journal= {arXiv preprint arXiv:2008.02940},
  year   = {2020}
}