3D 基础模型中的涌现极端视角几何
计算机视觉与模式识别
2025-12-03 v2
摘要
3D 基础模型(3DFMs)最近 revolutionized 3D vision,使能够直接从图像中联合预测深度、姿态和点图。然而,它们在面对极端、非重叠视角时的推理能力仍基本未被探索。本文研究了它们的内部表示,发现 3DFMs exhibit an emergent understanding of extreme-view geometry,尽管从未为此训练。为进一步增强这些能力,我们引入了一个轻量级对齐方案,通过仅微调少数 backbone bias 术语来细化其内部 3D 表示,同时保持所有 decoder 头冻结。这种有针对性的适应显著改进了在极端视角下的数据相对姿态估计,而不会损害每图像深度或点质量。此外,我们贡献 MegaUnScene,一个新的 Internet 场景基准,未被现有 3DFMs 看到,包含专为相对姿态估计和稠密 3D 重建各设定的测试子集。所有代码和数据将公开 release。
关键词
引用
@article{arxiv.2511.22686,
title = {Emergent Extreme-View Geometry in 3D Foundation Models},
author = {Yiwen Zhang and Joseph Tung and Ruojin Cai and David Fouhey and Hadar Averbuch-Elor},
journal= {arXiv preprint arXiv:2511.22686},
year = {2025}
}
备注
Project page is at https://ext-3dfms.github.io/