中文

MV-DUSt3R+:2 秒内从稀疏视图进行单阶段场景重建

计算机视觉与模式识别 2024-12-11 v1 人工智能

摘要

近期稀疏多视图场景重建的进展如 DUSt3R 和 MASt3R 不再需要相机标定和相机姿态估计。然而,它们每次仅处理一对视图来推断像素对齐的点图。当处理超过两个视图时,通常会进行大量易出错的成对重建,随后进行昂贵的全局优化,往往无法纠正成对重建误差。为了处理更多视图、减少误差并改善推理时间,我们提出了快速单阶段前馈网络 MV-DUSt3R。其核心是跨任意数量视图交换信息的多视图解码块,同时考虑一个参考视图。为了使我们的方法对参考视图选择具有鲁棒性,我们进一步提出了 MV-DUSt3R+,它采用跨参考视图块来融合不同参考视图选择的信息。为了进一步实现新视图合成,我们通过添加并联合训练高斯溅射头 (Gaussian splatting heads) 来扩展两者。在多视图立体重建、多视图姿态估计和新视图合成上的实验证实,我们的方法显著优于先前最先进方法。代码将公开发布。

关键词

引用

@article{arxiv.2412.06974,
  title  = {MV-DUSt3R+: Single-Stage Scene Reconstruction from Sparse Views In 2 Seconds},
  author = {Zhenggang Tang and Yuchen Fan and Dilin Wang and Hongyu Xu and Rakesh Ranjan and Alexander Schwing and Zhicheng Yan},
  journal= {arXiv preprint arXiv:2412.06974},
  year   = {2024}
}