用于复杂多智能体环境中驾驶策略学习的视觉 Transformer
机器学习
2021-09-15 v1 人工智能
多智能体系统
机器人学
摘要
在复杂城市环境中驾驶是一项困难任务,需要复杂的决策策略。为了做出明智决策,需要理解长程上下文以及其他车辆的重要性。本文中,我们提出使用 Vision Transformer (ViT) 以鸟瞰图(BEV)输入图像学习城市环境中的驾驶策略。ViT 网络比先前提出的卷积神经网络(ConvNets)更有效地学习场景的全局上下文。此外,ViT 的注意力机制有助于学习场景的注意力图,使自车能够确定哪些周围车辆对其下一步决策重要。我们证明,带有 ViT 主干的 DQN 智能体优于以各种方式预训练的 ConvNet 主干基线算法。特别地,所提方法有助于强化学习算法比基线学习更快、性能更高且所需数据更少。
引用
@article{arxiv.2109.06514,
title = {Vision Transformer for Learning Driving Policies in Complex Multi-Agent Environments},
author = {Eshagh Kargar and Ville Kyrki},
journal= {arXiv preprint arXiv:2109.06514},
year = {2021}
}