MVTN:用于 3D 形状识别的多视图变换网络
计算机视觉与模式识别
2021-08-18 v3 机器学习
摘要
多视图投影方法已证明其能够在 3D 形状识别上达到 SOTA 性能。这些方法学习从不同视图聚合信息的不同方式。然而,这些视图的相机视点往往是启发式设定并对所有形状固定。为规避当前多视图方法缺乏动态性的问题,我们提出学习这些视点。具体而言,我们引入多视图变换网络(MVTN),基于可微渲染的进展回归出用于 3D 形状识别的最优视点。因此,MVTN 可与任何用于 3D 形状分类的多视图网络端到端联合训练。我们将 MVTN 集成到一个新颖的自适应多视图流程中,该流程可渲染 3D 网格或点云。MVTN 在 3D 形状分类和 3D 形状检索任务上展现出明显的性能提升,且无需额外训练监督。在这些任务中,MVTN 在 ModelNet40、ShapeNet Core55 以及最新且最真实的 ScanObjectNN 数据集上取得了 SOTA 性能(最高 6% 提升)。有趣的是,我们还表明 MVTN 能提供网络在 3D 域中对旋转和遮挡的鲁棒性。代码见 https://github.com/ajhamdi/MVTN 。
引用
@article{arxiv.2011.13244,
title = {MVTN: Multi-View Transformation Network for 3D Shape Recognition},
author = {Abdullah Hamdi and Silvio Giancola and Bernard Ghanem},
journal= {arXiv preprint arXiv:2011.13244},
year = {2021}
}
备注
Published at ICCV 2021