中文

通过将单张 2D 图像提升至 3D 空间学习稠密特征匹配

计算机视觉与模式识别 2025-07-08 v2

摘要

特征匹配在许多计算机视觉任务中发挥着基本作用,但现有方法严重依赖稀缺且干净的多视图图像集合,这限制了其在多样化且具挑战性场景中的泛化能力。此外,传统特征编码器通常在单视图 2D 图像上进行训练,限制了其捕获 3D 感知对应关系的能力。本文提出了一种新颖的两阶段框架,将 2D 图像提升至 3D 空间,称为“Lift to Match (L2M)”,充分利用大规模且多样化的单视图图像。具体而言,在第一阶段,我们学习一个 3D 感知特征编码器,结合多视图图像合成和 3D 特征高斯表示,这将 3D 几何知识注入编码器中。在第二阶段,采用新视角渲染策略结合来自单视图图像的大规模合成数据生成,学习特征解码器以实现稳健的特征匹配,从而实现跨不同域的泛化。广泛的实验表明,我们的方法在零样态评估基准上实现了优异的泛化,凸显了该框架用于稳健特征匹配的有效性。

关键词

引用

@article{arxiv.2507.00392,
  title  = {Learning Dense Feature Matching via Lifting Single 2D Image to 3D Space},
  author = {Yingping Liang and Yutao Hu and Wenqi Shao and Ying Fu},
  journal= {arXiv preprint arXiv:2507.00392},
  year   = {2025}
}

备注

Official Code: https://github.com/Sharpiless/L2M