OV-Uni3DETR:通过循环模态传播迈向统一的开放词汇 3D 目标检测
计算机视觉与模式识别
2024-07-24 v2
摘要
在当前 3D 目标检测研究中,标注 3D 数据的严重稀缺、不同数据模态之间的巨大差异以及统一架构的缺失,阻碍了向通用性目标迈进的进程。在本文中,我们提出了 \textbf{OV-Uni3DETR},一种通过循环模态传播实现的统一开放词汇 3D 检测器。与现有的 3D 检测器相比,OV-Uni3DETR 具有明显的优势:1) 开放词汇 3D 检测:在训练期间,它利用各种可获取的数据,特别是大量的 2D 检测图像,来提升训练多样性。在推理期间,它可以检测已见和未见类别。2) 模态统一:它无缝地适应来自任何给定模态的输入数据,有效处理涉及不同模态或传感器信息缺失的场景,从而支持测试时模态切换。3) 场景统一:它为不同传感器采集的多样化场景提供了统一的多模态模型架构。具体而言,我们提出了循环模态传播,旨在传播桥接 2D 和 3D 模态的知识,以支持上述功能。来自大词汇量学习的 2D 语义知识指导 3D 领域中的新类别发现,而 3D 几何知识为 2D 检测图像提供定位监督。OV-Uni3DETR 在各种场景下实现了最先进的性能,平均超过现有方法 6% 以上。其仅使用 RGB 图像的性能与先前的基于点云的方法相当甚至更优。代码和预训练模型将在稍后发布。
引用
@article{arxiv.2403.19580,
title = {OV-Uni3DETR: Towards Unified Open-Vocabulary 3D Object Detection via Cycle-Modality Propagation},
author = {Zhenyu Wang and Yali Li and Taichi Liu and Hengshuang Zhao and Shengjin Wang},
journal= {arXiv preprint arXiv:2403.19580},
year = {2024}
}
备注
Accepted by ECCV2024