中文

基于优先经验的多车追捕渐进认知强化学习

人工智能 2023-06-09 v1

摘要

多车追捕(MVP)(如自动驾驶警车追捕嫌疑车)十分重要但极具挑战性,因其任务与安全关键性质。尽管已有多智能体强化学习(MARL)算法用于网格化结构道路的MVP问题,现有算法在集中式学习中采用随机训练样本,导致同质智能体协作性能低下。对于追捕多个逃逸车辆的更具挑战性问题,这些算法通常为追捕车选定固定目标逃逸车而未考虑动态交通态势,显著降低了追捕成功率。为解决上述问题,本文提出一种用于城市多路口动态交通场景、带优先经验的渐进认知强化学习(PEPCRL-MVP)。PEPCRL-MVP使用优先网络依据各MARL智能体参数评估全局经验回放缓冲区中的转移。通过优先网络选出的个性化优先经验集,为MARL学习过程引入多样性,从而提升协作与任务相关性能。此外,PEPCRL-MVP采用注意力模块从复杂城市交通环境中提取关键特征。这些特征用于发展渐进认知方法以自适应地编组追捕车辆。每组在动态驾驶环境中高效锁定一辆逃逸车。基于城市非结构化道路模拟器的大量实验表明,PEPCRL-MVP优于其他最先进方法。具体而言,PEPCRL-MVP较TD3-DMAP追捕效率提升3.95%,成功率比MADDPG高34.78%。代码已开源。

关键词

引用

@article{arxiv.2306.05016,
  title  = {Progression Cognition Reinforcement Learning with Prioritized Experience for Multi-Vehicle Pursuit},
  author = {Xinhang Li and Yiying Yang and Zheng Yuan and Zhe Wang and Qinwen Wang and Chen Xu and Lei Li and Jianhua He and Lin Zhang},
  journal= {arXiv preprint arXiv:2306.05016},
  year   = {2023}
}