中文

用于复杂多智能体环境中驾驶策略学习的视觉 Transformer

机器学习 2021-09-15 v1 人工智能 多智能体系统 机器人学

摘要

在复杂城市环境中驾驶是一项困难任务,需要复杂的决策策略。为了做出明智决策,需要理解长程上下文以及其他车辆的重要性。本文中,我们提出使用 Vision Transformer (ViT) 以鸟瞰图(BEV)输入图像学习城市环境中的驾驶策略。ViT 网络比先前提出的卷积神经网络(ConvNets)更有效地学习场景的全局上下文。此外,ViT 的注意力机制有助于学习场景的注意力图,使自车能够确定哪些周围车辆对其下一步决策重要。我们证明,带有 ViT 主干的 DQN 智能体优于以各种方式预训练的 ConvNet 主干基线算法。特别地,所提方法有助于强化学习算法比基线学习更快、性能更高且所需数据更少。

关键词

引用

@article{arxiv.2109.06514,
  title  = {Vision Transformer for Learning Driving Policies in Complex Multi-Agent Environments},
  author = {Eshagh Kargar and Ville Kyrki},
  journal= {arXiv preprint arXiv:2109.06514},
  year   = {2021}
}