分割合并:端到端自动驾驶中的运动与语义学习
计算机视觉与模式识别
2025-11-19 v3
摘要
感知环境及其随时间变化的情况,对应两种基本且异构的信息类型:语义和运动。以往的端到端自动驾驶工作将两种信息类型表示为单个特征向量。然而,包含预测和规划等与运动相关的任务,会损害检测和跟踪性能,导致多任务学习中的负迁移现象。为此,我们提出了神经贝叶斯运动解码,这是一种新的并行检测、跟踪和预测方法,分离语义和运动学习。具体而言,我们采用一组学习的运动查询,与检测和跟踪查询并行工作,共享一组递归更新的参考点。此外,我们采用交互式语义解码以增强语义任务间的信息交换,促进正向迁移。在 UniAD 和 SparseDrive 数据集上进行的实验表明,我们的分割合并方法在感知、预测和规划方面均取得了性能提升。我们的代码已公开:https://github.com/shenyinzhe/DMAD。
引用
@article{arxiv.2502.07631,
title = {Divide and Merge: Motion and Semantic Learning in End-to-End Autonomous Driving},
author = {Yinzhe Shen and Omer Sahin Tas and Kaiwen Wang and Royden Wagner and Christoph Stiller},
journal= {arXiv preprint arXiv:2502.07631},
year = {2025}
}