中文

MonoATT:基于自适应令牌Transformer的在线单目三维目标检测

计算机视觉与模式识别 2023-03-24 v1

摘要

移动端单目三维目标检测(Mono3D)(例如搭载于车辆、无人机或机器人上)是一项重要且具有挑战性的任务。现有基于Transformer的离线Mono3D模型采用基于网格的视觉令牌,在可用算力有限而使用粗粒度令牌时效果不佳。本文提出一种名为MonoATT的在线Mono3D框架,其利用具有不同形状与尺寸异构令牌的新型视觉Transformer来促进移动端Mono3D。MonoATT的核心思想是在使用Transformer增强Mono3D之前,自适应地将更细粒度令牌分配给更重要的区域。为此,我们首先利用先验知识设计打分网络以选取图像中最重要的区域,随后提出带注意力机制的令牌聚类与合并网络,在多个阶段中逐步合并所选区域周围的令牌。最后,在采用SOTA Mono3D检测器作为底层检测核心之前,由异构令牌重建像素级特征图。在真实世界KITTI数据集上的实验结果表明,MonoATT能有效提升近处与远处物体的Mono3D精度并保证低延迟。MonoATT以显著优势优于当前最先进方法,并在KITTI 3D基准测试中排名第一。

关键词

引用

@article{arxiv.2303.13018,
  title  = {MonoATT: Online Monocular 3D Object Detection with Adaptive Token Transformer},
  author = {Yunsong Zhou and Hongzi Zhu and Quan Liu and Shan Chang and Minyi Guo},
  journal= {arXiv preprint arXiv:2303.13018},
  year   = {2023}
}

备注

in the Proceedings of IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2023