中文

视几何 grounding transformer 中的显现性离群视图过滤

计算机视觉与模式识别 2025-12-04 v1

摘要

可靠的从野外图像集合进行3D重建常受到“噪声”图像——与其他图像几乎无关的输入——的阻碍。虽然传统Structure-from-Motion管道通过几何验证和离群点过滤处理此类情况,但基于 feed-forward 的3D重建模型缺乏这些显式机制,导致在野外条件下性能下降。本文发现,现有的 feed-forward 重建模型(例如VGGT),尽管缺乏显式离群点过滤机制或噪声感知训练,仍能本质上区分干扰图像。通过在不同比例的合成干扰图像下进行深入分析,我们识别出一个特定层天然 exhibits 离群点抑制行为。进一步探究表明,该层编码判别性内部表征,使其有效的噪声过滤能力得以实现。我们仅利用这一隐式过滤机制即可在无需额外微调或监督的情况下,对 feed-forward 3D重建进行离群视图过滤。广泛的在控制环境和野外数据集上的实验表明,这种隐式过滤机制是一致的,并且在多种场景中具有良好的概括性。

关键词

引用

@article{arxiv.2512.04012,
  title  = {Emergent Outlier View Rejection in Visual Geometry Grounded Transformers},
  author = {Jisang Han and Sunghwan Hong and Jaewoo Jung and Wooseok Jang and Honggyu An and Qianqian Wang and Seungryong Kim and Chen Feng},
  journal= {arXiv preprint arXiv:2512.04012},
  year   = {2025}
}

备注

Project page: https://cvlab-kaist.github.io/RobustVGGT/