中文

Video Depth Anything:超长视频的一致深度估计

计算机视觉与模式识别 2025-06-17 v3 人工智能

摘要

Depth Anything 在单目深度估计方面取得了显著成功,具备强大的泛化能力。然而,它在视频中存在时间一致性问题,限制了实际应用。已提出 various 方法通过利用视频生成模型或引入光流和相机姿态等先验来缓解此问题。然而,这些方法仅适用于短视频(<10秒),且在质量和计算效率之间需要权衡。我们提出 Video Depth Anything 用于超长视频(数分钟以上)的高质量、一致深度估计,且不牺牲效率。我们基于 Depth Anything V2,将其头部分离为高效的时空头。我们设计一种简洁而有效的时序深度梯度约束损失,无需额外几何先验。该模型在视频深度和无标签图像的联合数据集上训练,类似 Depth Anything V2。此外,我们开发了一种基于关键帧的超长视频推理策略。实验表明,我们的模型可应用于任意长度的视频,而不牺牲质量、一致性或泛化能力。多项视频基准测试的全面评估表明,我们的方法在零-shot视频深度估计中树立了新标杆。我们提供不同规模的模型以支持各种场景,其中最小模型即可实现30 FPS的实时性能。

关键词

引用

@article{arxiv.2501.12375,
  title  = {Video Depth Anything: Consistent Depth Estimation for Super-Long Videos},
  author = {Sili Chen and Hengkai Guo and Shengnan Zhu and Feihu Zhang and Zilong Huang and Jiashi Feng and Bingyi Kang},
  journal= {arXiv preprint arXiv:2501.12375},
  year   = {2025}
}

备注

Project page: https://videodepthanything.github.io/