中文

多视角基础模型

计算机视觉与模式识别 2025-12-18 v1

摘要

基础模型是各种计算机视觉应用中的重要工具。它们以单个RGB图像为输入,输出一种可用于各种应用的深层特征表示。然而,当我们拥有同一3D场景的多个视图时,它们会对每张图像独立地运行,始终不会产生一致的对应点特征。我们提出了一种方法,将基础模型转换为多视角基础模型。此类模型以一组图像为输入,为每个图像输出一个特征图,使得对应点的特征尽可能一致。这一方法绕过了构建特征3D模型并直接操作图像空间的需求。具体而言,我们展示了如何增强基于Transformer的基础模型(即DINO、SAM、CLIP)以中间3D感知注意力层,以帮助匹配不同视角间的特征。作为具体例子,我们展示了表面法线估计和多视角分割任务。定量实验表明,我们的方法在当前基础模型之上显著改进了特征匹配。

关键词

引用

@article{arxiv.2512.15708,
  title  = {Multi-View Foundation Models},
  author = {Leo Segre and Or Hirschorn and Shai Avidan},
  journal= {arXiv preprint arXiv:2512.15708},
  year   = {2025}
}