中文

一种用于自动驾驶多智能体协同训练的新方法

人工智能 2022-09-07 v1

摘要

在自动驾驶复杂场景中训练多个智能体执行安全且协同的控制一直是一项挑战。针对一小队协同行驶车辆,本文提出 Lepus,一种训练多智能体的新方法。Lepus 采用纯协同方式训练多智能体,其特点为策略网络参数共享与多智能体奖励函数共享。特别地,Lepus 通过对抗过程预训练策略网络,提升其协同决策能力并进一步改善行车稳定性。此外,为缓解稀疏奖励问题,Lepus 结合随机网络与蒸馏网络从专家轨迹中学习近似奖励函数。我们在 MADRaS 仿真平台上进行了大量实验。实验结果表明,由 Lepus 训练的多智能体在同时行驶时能够尽可能避免碰撞,并在稳定性方面优于其他四种方法,即 DDPG-FDE、PSDDPG、MADDPG 和 MAGAIL(DDPG)。

关键词

引用

@article{arxiv.2209.02157,
  title  = {A New Approach to Training Multiple Cooperative Agents for Autonomous Driving},
  author = {Ruiyang Yang and Siheng Li and Beihong Jin},
  journal= {arXiv preprint arXiv:2209.02157},
  year   = {2022}
}

备注

8pages, IJCNN2022, Accepted