STrajNet:用于自动驾驶中占据流场预测的多模态分层 Transformer
计算机视觉与模式识别
2023-07-07 v2 人工智能
摘要
预测周围交通参与者的未来状态是自动驾驶车辆的一项关键能力。近期提出的占据流场预测引入了一种可扩展且有效的表示,以联合预测场景中周围智能体的未来运动。然而,具有挑战性的部分在于建模交通智能体之间潜在的社会交互以及占据与流之间的关系。因此,本文提出了一种新颖的多模态分层 Transformer 网络,其融合矢量化(智能体运动)与视觉(场景流、地图和占据)模态,并联合预测场景的流与占据。具体地,来自传感数据的视觉与矢量特征通过多阶段 Transformer 模块编码,然后通过具有时间像素级注意力的后融合 Transformer 模块。重要的是,设计了一个流引导的多头自注意力(FG-MSA)模块,以更好地聚合占据与流的信息并建模它们之间的数学关系。所提方法在 Waymo Open Motion Dataset 上进行了全面验证,并与若干最先进(SOTA)模型进行比较。结果表明,我们的模型相较于其他方法具有更紧凑的架构和数据输入,却能取得可比的性能。我们也展示了融入矢量化智能体运动特征及所提 FG-MSA 模块的有效性。与不带 FG-MSA 模块(在 2022 Waymo 占据与流预测挑战赛中获得第二名)的消融模型相比,当前模型对流与占据具有更好的可分性并取得进一步的性能提升。
引用
@article{arxiv.2208.00394,
title = {STrajNet: Multi-modal Hierarchical Transformer for Occupancy Flow Field Prediction in Autonomous Driving},
author = {Haochen Liu and Zhiyu Huang and Chen Lv},
journal= {arXiv preprint arXiv:2208.00394},
year = {2023}
}