V-MIND:利用多样化2D标注构建多功能单目室内3D检测器
计算机视觉与模式识别
2024-12-17 v1
摘要
室内单目3D目标检测领域正受到越来越多的关注,这得益于VR/AR和机器人应用需求的增长。然而,由于3D数据收集和标注过程的劳动密集型特性,3D训练数据的可用性和多样性有限,阻碍了其发展。在本文中,我们提出了V-MIND(多功能单目室内检测器),它通过利用公开可用的大规模2D数据集,提升了室内3D检测器在多样化目标类别上的性能。通过利用成熟的单目深度估计技术和相机内参预测器,我们可以将大规模2D图像转换为3D点云,并随后生成伪3D边界框,从而生成3D训练数据。为了减轻转换点云中固有的距离误差,我们引入了一种新颖的3D自校准损失,用于在训练过程中细化伪3D边界框。此外,我们提出了一种新颖的模糊性损失,以解决从2D数据集引入新类别时出现的模糊性问题。最后,通过与现有3D数据集以及从2D数据集导出的伪3D边界框进行联合训练,V-MIND在Omni3D室内数据集上实现了广泛类别上的最先进目标检测性能。
引用
@article{arxiv.2412.11412,
title = {V-MIND: Building Versatile Monocular Indoor 3D Detector with Diverse 2D Annotations},
author = {Jin-Cheng Jhang and Tao Tu and Fu-En Wang and Ke Zhang and Min Sun and Cheng-Hao Kuo},
journal= {arXiv preprint arXiv:2412.11412},
year = {2024}
}
备注
WACV 2025