中文

S$^3$-MonoDETR:用于单目三维目标检测的感知形状与尺度的监督可变形Transformer

计算机视觉与模式识别 2024-08-22 v2 机器人学 图像与视频处理

摘要

近年来,基于Transformer的方法在单目三维目标检测中表现出优异性能,可从单张二维图像预测三维属性。这些方法通常利用视觉与深度表示在物体上生成查询点,其质量对检测精度起决定性作用。然而,当前Transformer中无任何几何外观感知的无监督注意力机制易为查询点产生噪声特征,严重限制网络性能,并使模型在单次训练过程中检测多类别物体的能力较差。为解决此问题,本文提出一种用于单目三维目标检测的新型“感知形状与尺度的监督可变形注意力”(S3^3-DA)模块。具体而言,S3^3-DA利用视觉与深度特征生成具有多种形状与尺度的多样化局部特征,并同时预测相应的匹配分布,从而为每个查询施加有价值的形状与尺度感知。得益于此,S3^3-DA可有效估计属于任意类别的查询点的感受野,使其生成鲁棒的查询特征。此外,我们提出基于多分类的形状与尺度匹配(MSM)损失来监督上述过程。在KITTI和Waymo Open数据集上的大量实验表明,S3^3-DA显著提升了检测精度,在单次训练过程中相比现有方法取得了单类别与多类别三维目标检测的SOTA性能。源代码将公开于 https://github.com/mikasa3lili/S3-MonoDETR。

关键词

引用

@article{arxiv.2309.00928,
  title  = {S$^3$-MonoDETR: Supervised Shape&Scale-perceptive Deformable Transformer for Monocular 3D Object Detection},
  author = {Xuan He and Jin Yuan and Kailun Yang and Zhenchao Zeng and Zhiyong Li},
  journal= {arXiv preprint arXiv:2309.00928},
  year   = {2024}
}

备注

The source code will be made publicly available at https://github.com/mikasa3lili/S3-MonoDETR