VoxDet:用于新颖实例检测的体素学习
计算机视觉与模式识别
2023-10-17 v4
摘要
基于多视图模板检测未见实例因其开放世界性质而是一个挑战性问题。主要依赖2D表征与匹配技术的传统方法,常不足以应对姿态变化与遮挡。为此,我们引入VoxDet,一个开创性的3D几何感知框架,充分利用强大的3D体素表征与可靠的体素匹配机制。VoxDet首先巧妙提出模板体素聚合(TVA)模块,有效将多视图2D图像转化为3D体素特征。借助关联的相机位姿,这些特征被聚合为一个紧凑的3D模板体素。在新颖实例检测中,该体素表征对遮挡和姿态变化表现出更高的鲁棒性。我们还发现3D重建目标有助于预训练TVA中的2D-3D映射。其次,为快速与模板体素对齐,VoxDet融入查询体素匹配(QVM)模块。2D查询先通过习得的2D-3D映射转化为其体素表征。我们发现由于3D体素表征编码了几何信息,我们可以先估计相对旋转再比较对齐后的体素,从而提升精度与效率。除方法外,我们还引入首个实例检测基准RoboTools,其中20个独特实例以相机外参视频录制。RoboTools还提供24个具有超过9k边界框标注的困难杂乱场景。在严苛的LineMod-Occlusion、YCB-video和RoboTools基准上进行了详尽实验,VoxDet以更快速度显著优于各类2D基线。据我们所知,VoxDet是首个将隐式3D知识用于2D新颖实例检测任务的模型。
引用
@article{arxiv.2305.17220,
title = {VoxDet: Voxel Learning for Novel Instance Detection},
author = {Bowen Li and Jiashun Wang and Yaoyu Hu and Chen Wang and Sebastian Scherer},
journal= {arXiv preprint arXiv:2305.17220},
year = {2023}
}
备注
18 pages, 9 figures