中文

弥合维度鸿沟:面向三维分析的二维视觉模型适配分类体系与综述

计算机视觉与模式识别 2026-04-07 v1

摘要

卷积神经网络(CNN)与视觉Transformer(ViT)在二维视觉领域的巨大成功,推动了将这些架构扩展到复杂三维分析领域的大量研究。然而,一个核心挑战源于二维图像规则、密集的网格与三维数据(如点云和网格)不规则、稀疏的特性之间的根本差异。本综述对弥合这一鸿沟的适配策略进行了全面回顾,并提出了一个统一的分类体系,将其归为三类:(1)以数据为中心的方法,将三维数据投影到二维格式以利用现成的二维模型;(2)以架构为中心的方法,设计内生的三维网络;以及(3)混合方法,协同结合两种建模范式,以同时受益于大规模二维数据集的丰富视觉先验和三维模型的显式几何推理。通过这一框架,我们定性分析了这些类别在计算复杂度、对大规模预训练的依赖以及几何归纳偏置的保持之间的根本权衡。我们讨论了关键的开放挑战,并概述了有前景的未来研究方向,包括三维基础模型的开发、面向几何数据的自监督学习(SSL)进展,以及多模态信号的更深层次整合。

关键词

引用

@article{arxiv.2604.03334,
  title  = {Bridging the Dimensionality Gap: A Taxonomy and Survey of 2D Vision Model Adaptation for 3D Analysis},
  author = {Akshat Pandya and Bhavuk Jain},
  journal= {arXiv preprint arXiv:2604.03334},
  year   = {2026}
}

备注

VISAPP 2026