中文

MV-DETR: 基于多视图检测Transformer的多模态室内目标检测

计算机视觉与模式识别 2024-08-14 v1

摘要

我们提出了一种新颖的MV-DETR流水线,这是一种有效且高效的基于Transformer的检测方法。给定RGBD输入数据,我们注意到RGB数据有非常强的预训练权重,而深度相关数据的有效工作较少。首先,我们认为几何线索和纹理线索都至关重要,但可以分别编码。其次,我们发现视觉纹理特征在3D空间中相对难以提取,而几何特征则较易提取。不幸的是,仅有数千条数据的单一RGBD数据集不足以训练一个用于视觉纹理特征提取的判别性滤波器。最后但同样重要的是,我们设计了一个轻量级的VG模块,由视觉文本编码器、几何编码器和VG连接器组成。与V-DETR等先前最先进工作相比,可以从预训练视觉编码器中获益。在ScanNetV2数据集上的广泛实验证明了我们的方法的有效性。值得注意的是,我们的方法实现了78%的AP,在ScanNetV2基准测试上创造了新的最先进结果。

关键词

引用

@article{arxiv.2408.06604,
  title  = {MV-DETR: Multi-modality indoor object detection by Multi-View DEtecton TRansformers},
  author = {Zichao Dong and Yilin Zhang and Xufeng Huang and Hang Ji and Zhan Shi and Xin Zhan and Junbo Chen},
  journal= {arXiv preprint arXiv:2408.06604},
  year   = {2024}
}