基于无约束图像的前馈 3D 重建综述:从 DUSt3R 到 VGGT
计算机视觉与模式识别
2025-07-14 v1 人工智能
摘要
3D 重建旨在恢复场景的稠密三维结构,是诸多应用(包括增强/虚拟现实、自动驾驶和机器人)的核心技术。虽然传统管道如结构从运动(SfM)和多视角立体(MVS)通过迭代优化实现高精度,但受限于复杂的工作流程、高计算成本以及在纹理缺失区域等挑战情景下的鲁棒性较差。最近,深度学习催化了 3D 重建的范式转变。以 DUSt3R 为代表的一类新模型开创了前馈方法。这些模型采用统一的深度网络从无约束的图像集合中单次前向传递中联合推断相机姿态和稠密几何。本综述系统性地审阅了这一新兴领域。我们首先剖析了这些前馈模型的技术框架,包括基于 Transformer 的对应关系建模、联合姿态和几何回归机制,以及从双视角扩展到多视角的策略。为凸显这一新范式的颠覆性,我们将其与传统管道和更早基于学习的方法如 MVSNet 进行对比。此外,我们概述了相关数据集和评估指标。最后,我们讨论了该技术的广泛应用前景,并指出关键的未来挑战和机遇,如模型精度和可扩展性,以及处理动态场景。
引用
@article{arxiv.2507.08448,
title = {Review of Feed-forward 3D Reconstruction: From DUSt3R to VGGT},
author = {Wei Zhang and Yihang Wu and Songhua Li and Wenjie Ma and Xin Ma and Qiang Li and Qi Wang},
journal= {arXiv preprint arXiv:2507.08448},
year = {2025}
}