中文

通过互联网视频弱监督对 3D 几何基础模型进行可扩展适应

计算机视觉与模式识别 2026-02-10 v1 人工智能

摘要

几何基础模型在 3D 重建方面显示出前景,但其进展严重受限于稀缺且规模受限的 3D 标注。虽然互联网视频提供了几乎无限的原始数据,但由于缺乏真实几何和观察噪声的存在,将其用作几何学习的扩展来源具有挑战。为此,我们提出了 SAGE,即 Scalable Adaptation of GEometric foundation models from raw video streams 的框架。SAGE 利用分层矿掘管线将视频转化为训练轨迹和混合监督:(1) 信息丰富的训练轨迹选择;(2) 通过 SfM 点云实现稀疏几何锚定,以提供全局结构指导;(3) 通过 3D 高斯渲染实现稠密可微一致性,以提供多视图约束。为防止灾难性遗忘,我们引入了基于锚定数据的正则化策略。广泛的实验表明,SAGE 在零样 generalization 上显著提升,相对于最先进的基线方法,在不可见基准(7Scenes、TUM-RGBD、Matterport3D)上将 Chamfer Distance 降低 20%-42%。在我们知识的意识到,SAGE 首次通过互联网视频实现了几何基础模型的适应,确立了面向通用 3D 学习的可扩展范式。

关键词

引用

@article{arxiv.2602.07891,
  title  = {Scalable Adaptation of 3D Geometric Foundation Models via Weak Supervision from Internet Video},
  author = {Zihui Gao and Ke Liu and Donny Y. Chen and Duochao Shi and Guosheng Lin and Hao Chen and Chunhua Shen},
  journal= {arXiv preprint arXiv:2602.07891},
  year   = {2026}
}