中文

面向多智能体追逃博弈的极小极大 Q 学习

系统与控制 2020-03-10 v1 系统与控制 最优化与控制

摘要

在本文中,我们利用强化学习和矩阵博弈论的工具与技术来解决涉及多个参与者的追逃博弈。具体而言,我们考虑引导一个逃避者到达目标目的地同时避免被多个追捕者捕获的问题,这通常在高维且计算上难以处理。在我们提出的方法中,我们首先将多智能体追逃博弈表述为一系列离散矩阵博弈。接下来,为简化求解过程,我们将高维状态空间转化为低维流形,并将连续动作空间转化为基于特征的空间,即原空间的离散抽象。基于这些转化后的状态和动作空间,我们随后采用极小极大 Q 学习来生成博弈收益矩阵的条目,进而获得逃避者在每一阶段的最优动作。最后,我们给出大量数值仿真,从逃避者在不被捕获情况下到达期望目标位置的能力以及计算效率两方面评估所提出的基于学习的逃避策略的性能。

关键词

引用

@article{arxiv.2003.03727,
  title  = {Min-Max Q-Learning for Multi-Player Pursuit-Evasion Games},
  author = {Jhanani Selvakumar and Efstathios Bakolas},
  journal= {arXiv preprint arXiv:2003.03727},
  year   = {2020}
}