SEPT:面向高效场景表示学习的运动预测
计算机视觉与模式识别
2023-12-20 v4 机器学习
摘要
运动预测对于自动驾驶车辆在安全复杂的交通环境中运行至关重要。提取交通要素间有效的时空关系是对准确预测的关键。受预训练大语言模型成功实践的启发,本文提出 SEPT,一种利用自监督学习为复杂交通场景发展强大时空理解的建模框架。具体而言,我们的方法对包括智能体轨迹与道路网络在内的场景输入进行三项掩码-重建建模任务,预训练场景编码器以捕获轨迹内运动学、道路网络空间结构以及道路与智能体间交互。预训练的编码器随后在下游预测任务上微调。大量实验表明,SEPT 无需精细的架构设计或人工特征工程,即在 Argoverse 1 与 Argoverse 2 运动预测基准上达到最先进性能,在所有主要指标上大幅超越先前方法。
引用
@article{arxiv.2309.15289,
title = {SEPT: Towards Efficient Scene Representation Learning for Motion Prediction},
author = {Zhiqian Lan and Yuxuan Jiang and Yao Mu and Chen Chen and Shengbo Eben Li},
journal= {arXiv preprint arXiv:2309.15289},
year = {2023}
}