AMP:重新审视用于自动驾驶的下一词元预测自回归运动预测
计算机视觉与模式识别
2024-03-22 v2 机器人学
摘要
作为自动驾驶中的一项基本任务,运动预测旨在预测周围物体未来的状态以进行导航。一个自然的解决方案是以逐步的方式估计其他智能体的位置,其中每个预测的时间步长都依赖于观测到的时间步长和先前预测的时间步长,即自回归预测。像SocialLSTM和MFP这样的开创性工作就是基于这一直觉设计其解码器的。然而,几乎所有最先进的工作都假设所有预测的时间步长在给定观测时间步长的条件下是独立的,它们使用单个线性层同时生成所有时间步长的位置。由于训练多层感知机比训练自回归网络更简单,这些方法主导了大多数运动预测排行榜。在本文中,我们将GPT风格的下一词元预测引入运动预测。通过这种方式,输入和输出可以在一个统一的空间中表示,从而使自回归预测变得更加可行。然而,与由同质单元——词——组成的语言数据不同,驾驶场景中的元素可能具有复杂的时空和语义关系。为此,我们提出采用三个具有不同邻居的分解注意力模块进行信息聚合,并采用不同的位置编码风格来捕获它们的关系,例如,对空间相对性编码坐标系之间的变换,而对时间相对性采用旋转位置编码。实验表明,通过配备上述定制设计,所提出的方法在Waymo Open Motion和Waymo Interaction数据集上实现了最先进的性能。值得注意的是,AMP优于其他最近的自回归运动预测方法:MotionLM和StateTransformer,这证明了所提出设计的有效性。
引用
@article{arxiv.2403.13331,
title = {AMP: Autoregressive Motion Prediction Revisited with Next Token Prediction for Autonomous Driving},
author = {Xiaosong Jia and Shaoshuai Shi and Zijun Chen and Li Jiang and Wenlong Liao and Tao He and Junchi Yan},
journal= {arXiv preprint arXiv:2403.13331},
year = {2024}
}