依赖越少,学得越多:从稀疏无姿态图像合成新视角所需的最少 3D 知识
计算机视觉与模式识别
2026-04-21 v2
摘要
前馈式新颖视角合成(NVS)的最新进展导致了两种设计哲学的分歧:基于偏置的方法依赖显式 3D 知识(如手工制作的 3D 表示,例如 NeRF 和 3DGS,以及由结构从运动算法标注的相机姿态),以及以数据为中心的方法,它们从大规模图像数据中隐式地学习理解 3D 结构。这引发了一个基本问题:在数据可用性不断增长的年代,哪种范式更具可扩展性?在本文中,我们对现有方法进行了全面分析,发现了一个关键趋势:需要较少 3D 知识的方法的性能随训练数据增加而加速提升,最终超越其依赖 3D 知识的对应方法,我们称之为"依赖越少,学得越多"。受此发现启发,我们设计了一个前馈式 NVS 框架,去除了对显式场景结构和姿态标注的依赖。通过消除这些依赖,我们的方法利用极大的可扩展性,直接从大量 2D 图像中学习隐式 3D 意识,无需任何训练或推理的姿态信息。大量实验表明我们的模型达到了最先进的 NVS 性能,甚至超越了依赖姿态训练数据的方法。结果不仅验证了我们以数据为中心范式的有效性,也验证了可扩展性发现作为指导原则的力量。
引用
@article{arxiv.2506.09885,
title = {The Less You Depend, The More You Learn: Synthesizing Novel Views from Sparse, Unposed Images with Minimal 3D Knowledge},
author = {Haoru Wang and Kai Ye and Minghan Qin and Yangyan Li and Wenzheng Chen and Baoquan Chen},
journal= {arXiv preprint arXiv:2506.09885},
year = {2026}
}
备注
ICLR 2026