中文

无需视频模型的视频深度估计

计算机视觉与模式识别 2025-03-18 v2

摘要

视频深度估计将单目视频剪辑提升至三维,通过推断每个帧的稠密深度。近期单图像深度估计的进展,得益于大型基础模型的兴起和合成训练数据的使用,重新点燃了对视频深度的兴趣。然而,粗暴地将单图像深度估计器应用于视频的每个帧,会忽略时间连续性,不仅导致画面闪烁,还可能在相机运动导致深度范围突变时出现问题。一个明显且原则上可行的解决方案是构建在视频基础模型之上,但这些模型各自存在局限,包括昂贵的训练和推理、 imperfect 3D 一致性以及用于固定长度(短)输出的拼接例程。我们踏出一步,演示如何将单图像潜在扩散模型 (LDM) 转化为最先进的视频深度估计器。我们的模型称为 RollingDepth,包含两个主要要素:(i) 从单图像 LDM 导出的多帧深度估计器,将 very short video snippets(通常为帧三元组)映射到深度 snippets。(ii) 一个稳健的、基于优化的注册算法,将深度 snippets 在各种不同帧率下采样的深度片段 optimally 组合到一致的视频中。RollingDepth 能够有效处理长视频(包含数百帧),并比专门的视频深度估计器和高性能单帧模型交付更准确的深度视频。项目页面: rollingdepth.github.io。

关键词

引用

@article{arxiv.2411.19189,
  title  = {Video Depth without Video Models},
  author = {Bingxin Ke and Dominik Narnhofer and Shengyu Huang and Lei Ke and Torben Peters and Katerina Fragkiadaki and Anton Obukhov and Konrad Schindler},
  journal= {arXiv preprint arXiv:2411.19189},
  year   = {2025}
}

备注

Project page: rollingdepth.github.io