中文

通过可扩展合成数据实现视频深度估计

计算机视觉与模式识别 2025-03-13 v2 人工智能

摘要

视频深度估计长期受限于一致且可扩展的真实标注数据的稀缺,导致结果不一致且不可靠。本文介绍 Depth Any Video 模型,通过两种关键创新来解决这一挑战。首先,我们开发了可扩展的合成数据管道,从多样化的虚拟环境中捕获实时视频深度数据,产生 4 万段时长为 5 秒的视频剪辑,每段都有精确的深度标注。其次,我们利用强大的生成式视频扩散模型先验处理实际视频,集成旋转位置编码和流匹配等先进技术,以进一步提升灵活性和效率。不同于以往受限于固定长度视频序列的模型,我们的做法提出了一种新型的混合时长训练策略,能够处理不同时长的视频,并在各种帧率下表现稳健,甚至在单帧上也能良好运行。推理阶段,我们提出一种深度插值方法,使模型能够推理出高分辨率视频深度序列中最长达 150 帧的长度。我们的模型在空间精度和时间一致性方面均超越了所有以往的生成式深度模型。代码和模型权重已开源。

关键词

引用

@article{arxiv.2410.10815,
  title  = {Depth Any Video with Scalable Synthetic Data},
  author = {Honghui Yang and Di Huang and Wei Yin and Chunhua Shen and Haifeng Liu and Xiaofei He and Binbin Lin and Wanli Ouyang and Tong He},
  journal= {arXiv preprint arXiv:2410.10815},
  year   = {2025}
}

备注

Project Page: https://depthanyvideo.github.io/