中文

NOVA:面向自动驾驶的 3D 多目标跟踪的下一步开放词汇自回归

计算机视觉与模式识别 2026-03-09 v1 机器人学 图像与视频处理

摘要

跨未知目标的泛化是开放世界感知的关键挑战,而现有的 3D 多目标跟踪 (3D MOT) 流程仍受限于封闭集合假设和“语义盲区”启发式方法。为此,我们提出下一步开放词汇自回归 (Next-step Open-Vocabulary Autoregression, NOVA),一种创新的范式,将 3D 跟踪从传统的基于距离的碎片化匹配,转向生成的时空语义建模。NOVA 将 3D 轨迹重新表述为结构化的时空语义序列,使其能够同时编码物理运动连续性与深层语言先验。通过利用大型语言模型 (LLM) 的自回归能力,我们将跟踪任务转化为原则化的序列完成过程。这种机制允许模型显式利用语言空间的层次结构,以解决细粒度语义歧义,并通过高阶常识推理在复杂长程序列中保持身份一致性。大量实验在 nuScenes、V2X-Seq-SPD 和 KITTI 数据集上表明,NOVA 在实际应用中表现卓越。值得注意的是,在 nuScenes 数据集上,NOVA 在 Novel 类别的 AMOTA 可达 22.41%,相较于基线实现了高达 20.21% 的绝对提升。这一提升是通过一个紧凑的 0.5B 参数自回归模型实现的。代码将在 https://github.com/xifen523/NOVA 上发布。

关键词

引用

@article{arxiv.2603.06254,
  title  = {NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving},
  author = {Kai Luo and Xu Wang and Rui Fan and Kailun Yang},
  journal= {arXiv preprint arXiv:2603.06254},
  year   = {2026}
}

备注

Code will be available at https://github.com/xifen523/NOVA