中文

这些视图能构成同一场景吗?3D 基础模型产生幻觉时的多视图 3D 一致性评估

计算机视觉与模式识别 2026-05-19 v1

摘要

多视图 3D 评估假设被评分的图像是同一静态 3D 场景的观测结果。这一假设在 NVS 和稀疏视图重建中可能失效:输入或生成的输出可能包含伪影、离群帧、重复视图或噪声,但仍然获得高 3D 一致性分数。现有的基于参考的指标需要真实数据,而无需真实数据的指标(如 MEt3R)依赖于学习到的重建主干网络,其失效模式尚未得到充分表征。我们通过将神经重建先验与经典几何验证进行比较来研究这一可靠性问题。我们引入了 \benchmark,一个用于多视图 3D 一致性的受控鲁棒性基准,以及一个将神经指标分解为主干、残差和聚合组件的参数化族。该参数化族恢复了 MEt3R,并产生了鲁棒性提升高达 3×3\times 的变体。我们的分析表明,VGGT、MASt3R、DUSt3R 和 Fast3R 能够为不相关的场景、重复的图像和随机噪声产生密集几何和跨视图支持的幻觉。我们引入了基于 COLMAP 的指标,将匹配、配准、密集支持和重建失败作为感知失效的一致性信号。在真实的 NVS 输出和一项结构化的人类研究中,这些指标与人类判断的相关性比 MEt3R 高达 4×4\times

关键词

引用

@article{arxiv.2605.18754,
  title  = {Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate},
  author = {Soumava Paul and Prakhar Kaushik and Alan Yuille},
  journal= {arXiv preprint arXiv:2605.18754},
  year   = {2026}
}

备注

Project Page at https://mvp18.github.io/3d-consistency-metrics/