中文

GLT-T:用于点云中三维单目标跟踪的全局-局部Transformer投票

计算机视觉与模式识别 2022-11-22 v1

摘要

当前的三维单目标跟踪方法通常基于VoteNet(一种三维区域提议网络)。尽管取得了成功,但在VoteNet中使用单个种子点特征作为偏移学习的线索,阻碍了高质量三维提议的生成。此外,在投票过程中,不同重要性的种子点被平等对待,加剧了这一缺陷。为解决这些问题,我们提出了一种新颖的全局-局部Transformer投票方案,以提供更丰富的线索并引导模型更多关注潜在种子点,从而促进高质量三维提议的生成。在技术层面,采用全局-局部Transformer(GLT)模块将目标级和块级先验整合进种子点特征,以有效形成种子点几何位置的强特征表示,从而为偏移学习提供更鲁棒且准确的线索。随后,设计了一种简单而有效的训练策略来训练GLT模块。我们开发了一个重要性预测分支来学习种子点的潜在重要性,并将输出的权重向量作为训练约束项。通过将上述组件结合,我们展示了一种优越的跟踪方法GLT-T。在具有挑战性的KITTI和NuScenes基准上的大量实验表明,GLT-T在三维单目标跟踪任务中达到了最先进的性能。此外,进一步的消融研究显示了所提出的全局-局部Transformer投票方案相对于原始VoteNet的优势。代码和模型将发布于https://github.com/haooozi/GLT-T。

关键词

引用

@article{arxiv.2211.10927,
  title  = {GLT-T: Global-Local Transformer Voting for 3D Single Object Tracking in Point Clouds},
  author = {Jiahao Nie and Zhiwei He and Yuxiang Yang and Mingyu Gao and Jing Zhang},
  journal= {arXiv preprint arXiv:2211.10927},
  year   = {2022}
}

备注

Accepted to AAAI 2023. The source code and models will be available at https://github.com/haooozi/GLT-T