中文

MMF-Track:用于三维单目标跟踪的多模态多层次融合方法

计算机视觉与模式识别 2023-08-16 v2

摘要

三维单目标跟踪在计算机视觉中起着关键作用。主流方法主要依赖点云实现目标模板与搜索区域间的几何匹配。然而,缺乏纹理且不完整的点云使单模态跟踪器难以区分结构相似的物体。为克服几何匹配的局限,我们提出一种多模态多层次融合跟踪器(MMF-Track),其利用图像的纹理与点云的几何特征来跟踪三维目标。具体而言,我们首先提出空间对齐模块(SAM)在三维空间中对齐 RGB 图像与点云,这是构建模态间关联的先决条件。随后,在特征交互层面,我们设计基于双流结构的特征交互模块(FIM),其并行增强模态内特征并构建模态间语义关联。同时,为精炼各模态特征,我们引入由粗到细交互模块(CFIM)以实现不同尺度下的分层特征交互。最后,在相似度融合层面,我们提出相似度融合模块(SFM)以聚合来自目标的几何与纹理线索。实验表明,我们的方法在 KITTI 上取得最先进性能(相较先前多模态方法成功率提升 39%、精度提升 42%),并在 NuScenes 上同样具有竞争力。

关键词

引用

@article{arxiv.2305.06794,
  title  = {MMF-Track: Multi-modal Multi-level Fusion for 3D Single Object Tracking},
  author = {Zhiheng Li and Yubo Cui and Yu Lin and Zheng Fang},
  journal= {arXiv preprint arXiv:2305.06794},
  year   = {2023}
}

备注

11 pages, 10 figures