中文

一种基于互信息指标最大化的对手感知强化学习方法用于团队对团队多车辆追捕

多智能体系统 2022-10-25 v1

摘要

智慧城市中的追逃博弈给多车辆追捕(MVP)问题带来深远影响,其中警车协作追捕嫌疑车辆。现有 MVP 问题研究倾向于将逃逸车辆设置为随机移动或沿固定预设路线移动。对手建模方法在解决由对抗智能体引起的非平稳性方面已展现出可观前景。然而,大多数方法聚焦于双人竞争博弈以及无环境干扰的简单场景。本文考虑复杂城市场景中的团队对团队多车辆追捕(T2TMVP)问题,其中逃逸车辆采用预训练的动力学策略进行智能决策。为解决该问题,我们提出一种通过最大化互信息指标实现的对手感知强化学习(OARLM2I2)方法,以提升复杂环境中的追捕效率。首先,提出基于序列编码的对手联合策略建模(SEOJSM)机制,生成逃逸车辆的联合策略模型,辅助基于深度 Q 网络(DQN)的多智能体决策过程。随后,我们设计了一种互信息联合损失,同时考虑环境反馈的奖励与对手联合策略模型的有效性,以更新追捕车辆的决策过程。基于 SUMO 的大量实验表明,我们的方法在减少追捕时间上平均优于其他基线 21.48%。代码可在 \url{https://github.com/ANT-ITS/OARLM2I2} 获取。

关键词

引用

@article{arxiv.2210.13015,
  title  = {An Opponent-Aware Reinforcement Learning Method for Team-to-Team Multi-Vehicle Pursuit via Maximizing Mutual Information Indicator},
  author = {Qinwen Wang and Xinhang Li and Zheng Yuan and Yiying Yang and Chen Xu and Lin Zhang},
  journal= {arXiv preprint arXiv:2210.13015},
  year   = {2022}
}

备注

8 pages, 6 figures, accepted by MSN2022