DUSt3R:让几何 3D 视觉变得简单
计算机视觉与模式识别
2024-12-03 v3
摘要
野外多视图立体重建 (MVS) 需要首先估计相机参数(如内参和外参)。这些参数通常难以获取且繁琐,但对于在 3D 空间中三角化对应像素(这是所有高性能 MVS 算法的核心)却是必不可少的。在本文中,我们采取相反的立场,引入了 DUSt3R,这是一种针对任意图像集合进行密集且无约束立体 3D 重建 (Dense and Unconstrained Stereo 3D Reconstruction) 的 radically novel 范式,即无需关于相机校准或视点位姿的先验信息即可运行。我们将成对重建问题转化为点图 (pointmaps) 的回归问题,从而放松了通常投影相机模型的严格约束。我们证明,这种表述平滑地统一了单目和双目重建情况。在提供多于两张图像的情况下,我们进一步提出了一种简单而有效的全局对齐策略,将所有成对点图表达在公共参考系中。我们的网络架构基于标准的 Transformer 编码器和解码器,使我们能够利用强大的预训练模型。我们的表述直接提供了场景的 3D 模型以及深度信息,但有趣的是,我们可以从中无缝恢复像素匹配、相对和绝对相机参数。针对所有这些任务的详尽实验表明,所提出的 DUSt3R 能够统一各种 3D 视觉任务,并在单目/多视图深度估计以及相对位姿估计方面树立了新的 SOTA。总之,DUSt3R 使许多几何 3D 视觉任务变得简单。
引用
@article{arxiv.2312.14132,
title = {DUSt3R: Geometric 3D Vision Made Easy},
author = {Shuzhe Wang and Vincent Leroy and Yohann Cabon and Boris Chidlovskii and Jerome Revaud},
journal= {arXiv preprint arXiv:2312.14132},
year = {2024}
}
备注
fixing the ref for StaticThings3D dataset