中文

MVTN:用于三维理解的多视图变换学习

计算机视觉与模式识别 2025-05-28 v2 人工智能 图形学

摘要

多视图投影技术已在三维形状识别中展现出高度有效性并取得顶尖性能。这些方法学习如何融合来自多个视点的信息。然而,获取这些视图的相机视点通常对所有形状都是固定的。为克服当前多视图技术的静态特性,我们提出学习这些视点。具体而言,我们引入多视图变换网络(MVTN),其使用可微渲染来确定用于三维形状识别的最优视点。因此,MVTN可与任意多视图网络端到端训练以进行三维形状分类。我们将MVTN集成到一个新颖的自适应多视图流水线中,该流水线能够渲染三维网格和点云。我们的方法在多个基准(ModelNet40、ScanObjectNN、ShapeNet Core55)上的三维分类与形状检索中展示了最先进的性能。进一步分析表明,与其他方法相比,我们的方法对遮挡具有更好的鲁棒性。我们还研究了MVTN的其他方面,如二维预训练及其在分割中的使用。为支持该领域的进一步研究,我们发布了MVTorch,一个利用多视图投影进行三维理解与生成的PyTorch库。

关键词

引用

@article{arxiv.2212.13462,
  title  = {MVTN: Learning Multi-View Transformations for 3D Understanding},
  author = {Abdullah Hamdi and Faisal AlZahrani and Silvio Giancola and Bernard Ghanem},
  journal= {arXiv preprint arXiv:2212.13462},
  year   = {2025}
}

备注

under review journal extension for the ICCV 2021 paper arXiv:2011.13244