CAT-Det:用于多模态三维目标检测的对比增强Transformer
计算机视觉与模式识别
2022-04-05 v2
摘要
在自动驾驶中,激光雷达点云与RGB图像是三维目标检测的两个主要数据模态,具有互补线索。然而,由于模态间差异巨大,充分利用它们相当困难。为解决此问题,我们提出一种新颖框架,即用于多模态三维目标检测的对比增强Transformer(CAT-Det)。具体而言,CAT-Det采用双流结构,由Pointformer(PT)分支、Imageformer(IT)分支以及跨模态Transformer(CMT)模块组成。PT、IT与CMT联合编码模态内与模态间的长程上下文以表征物体,从而充分挖掘多模态信息用于检测。此外,我们提出一种有效的单向多模态数据增强(OMDA)方法,通过在点和物体层级的分层对比学习,仅增强点云即可显著提升精度,且无需复杂地生成两模态的配对样本。在KITTI基准上的大量实验表明,CAT-Det达到了新的最先进水平(SOTA),凸显了其有效性。
引用
@article{arxiv.2204.00325,
title = {CAT-Det: Contrastively Augmented Transformer for Multi-modal 3D Object Detection},
author = {Yanan Zhang and Jiaxin Chen and Di Huang},
journal= {arXiv preprint arXiv:2204.00325},
year = {2022}
}
备注
Accepted to CVPR 2022