MV-DETR: 基于多视图检测Transformer的多模态室内目标检测
计算机视觉与模式识别
2024-08-14 v1
摘要
我们提出了一种新颖的MV-DETR流水线,这是一种有效且高效的基于Transformer的检测方法。给定RGBD输入数据,我们注意到RGB数据有非常强的预训练权重,而深度相关数据的有效工作较少。首先,我们认为几何线索和纹理线索都至关重要,但可以分别编码。其次,我们发现视觉纹理特征在3D空间中相对难以提取,而几何特征则较易提取。不幸的是,仅有数千条数据的单一RGBD数据集不足以训练一个用于视觉纹理特征提取的判别性滤波器。最后但同样重要的是,我们设计了一个轻量级的VG模块,由视觉文本编码器、几何编码器和VG连接器组成。与V-DETR等先前最先进工作相比,可以从预训练视觉编码器中获益。在ScanNetV2数据集上的广泛实验证明了我们的方法的有效性。值得注意的是,我们的方法实现了78%的AP,在ScanNetV2基准测试上创造了新的最先进结果。
引用
@article{arxiv.2408.06604,
title = {MV-DETR: Multi-modality indoor object detection by Multi-View DEtecton TRansformers},
author = {Zichao Dong and Yilin Zhang and Xufeng Huang and Hang Ji and Zhan Shi and Xin Zhan and Junbo Chen},
journal= {arXiv preprint arXiv:2408.06604},
year = {2024}
}