中文

M3SOT:多帧、多场、多空间3D单目标跟踪

计算机视觉与模式识别 2023-12-12 v1

摘要

3D单目标跟踪(SOT)是计算机视觉领域的一项前沿任务,对自动驾驶等应用至关重要。场景点云中的稀疏和遮挡数据会导致被跟踪目标的外观发生变化,增加了任务的复杂性。在这项研究中,我们提出了M3SOT,一个新颖的3D SOT框架,它在一个模型中协同了多输入帧(模板集)、多感受野(连续上下文)和多解空间(不同任务)。值得注意的是,M3SOT开创性地直接从点云中建模时序性、上下文和任务,重新审视了影响SOT关键因素的视角。为此,我们设计了一个以搜索区域内的点云目标为中心的基于Transformer的网络,通过利用历史帧聚合多样化的上下文表示并传播目标线索。由于M3SOT涵盖了多样化的处理视角,我们精简了网络——削减其深度并优化其结构——以确保为SOT应用实现轻量级和高效的部署。我们认为,凭借实用的构建,M3SOT避开了对复杂框架和辅助组件的需求,即可提供出色的结果。在KITTI、nuScenes和Waymo Open Dataset等基准上的大量实验表明,M3SOT以38 FPS的速度实现了最先进的性能。我们的代码和模型可在https://github.com/ywu0912/TeamCode.git获取。

关键词

引用

@article{arxiv.2312.06117,
  title  = {M3SOT: Multi-frame, Multi-field, Multi-space 3D Single Object Tracking},
  author = {Jiaming Liu and Yue Wu and Maoguo Gong and Qiguang Miao and Wenping Ma and Can Qin},
  journal= {arXiv preprint arXiv:2312.06117},
  year   = {2023}
}

备注

12 pages, 10 figures, 10 tables, AAAI 2024