LatentFormer:基于多智能体 Transformer 的交互建模与轨迹预测
计算机视觉与模式识别
2022-03-04 v1
摘要
多智能体轨迹预测是自动驾驶中的一个基础问题。预测的关键挑战在于准确预判周围智能体的行为并理解场景上下文。为解决这些问题,我们提出 LatentFormer,一种基于 transformer 的用于预测未来车辆轨迹的模型。所提方法利用一种新颖的技术来建模场景中动态物体之间的交互。与许多在观测时间内建模智能体间交互的现有方法不同,我们的方法额外利用了智能体的未来状态。这是通过一种分层注意力机制实现的,其中智能体不断演化的状态以自回归方式控制过去轨迹与场景编码在最终预测中的贡献。此外,我们提出了一种多分辨率地图编码方案,该方案依赖视觉 transformer 模块来有效捕获局部与全局场景上下文,以引导生成更合理的未来轨迹。我们在 nuScenes 基准数据集上评估了所提方法,结果表明我们的方法达到了最先进的性能,并将轨迹指标提升了至多 40%。我们通过大量消融实验进一步研究了所提技术各组成部分的贡献。
引用
@article{arxiv.2203.01880,
title = {LatentFormer: Multi-Agent Transformer-Based Interaction Modeling and Trajectory Prediction},
author = {Elmira Amirloo and Amir Rasouli and Peter Lakner and Mohsen Rohani and Jun Luo},
journal= {arXiv preprint arXiv:2203.01880},
year = {2022}
}