中文

MegaSaM:从休闲动态视频中准确、快速且稳健的结构与运动估计

计算机视觉与模式识别 2024-12-10 v2

摘要

我们提出了一个系统,能够准确、快速且稳健地估计来自休闲单目动态场景视频中的相机参数和深度图。大多数传统的结构从运动和单目 SLAM 技术都假设输入视频主要是静态场景,具有大量视差。此类方法在缺乏这些条件时容易产生错误估计。最近的神经网络方法试图克服这些挑战;然而,这些方法要么计算昂贵,要么在面对动态视频、受控摄像机运动或未知场景视野时脆弱。我们展示了一个深级视觉 SLAM 框架的惊人效果:通过对其训练和推理方案进行精心修改,该系统可以扩展到具有不受约束摄像机路径的复杂动态场景视频,包括视差很小的视频。在合成和真实视频上的大量实验表明,我们的系统在相机姿态和深度估计方面在准确性和鲁棒性上显著优于先前和并行的工作,运行时间更快或相当。请参见我们的项目页面上的交互式结果:https://mega-sam.github.io/

关键词

引用

@article{arxiv.2412.04463,
  title  = {MegaSaM: Accurate, Fast, and Robust Structure and Motion from Casual Dynamic Videos},
  author = {Zhengqi Li and Richard Tucker and Forrester Cole and Qianqian Wang and Linyi Jin and Vickie Ye and Angjoo Kanazawa and Aleksander Holynski and Noah Snavely},
  journal= {arXiv preprint arXiv:2412.04463},
  year   = {2024}
}

备注

Project page: https://mega-sam.github.io/