从视频扩散先验学习时间一致性的视频深度
计算机视觉与模式识别
2025-06-10 v4
摘要
本工作解决了流式视频深度估计的挑战,该任务不仅要求每帧的精度,更重要的是跨帧的一致性。我们认为,在帧或片段之间共享上下文信息对于促进时间一致性至关重要。因此,我们将深度预测重新表述为一个条件生成问题,以在片段内和跨片段提供上下文信息。具体来说,我们为任意长视频提出了一种一致的上下文感知训练和推理策略,以提供跨片段上下文。在训练期间,我们为片段内的每一帧采样独立的噪声水平,同时使用滑动窗口策略,并用先前预测的帧初始化重叠帧而不添加噪声。此外,我们设计了一种有效的训练策略来提供片段内的上下文。大量的实验结果验证了我们的设计选择,并证明了我们方法(称为ChronoDepth)的优越性。项目页面:https://xdimlab.github.io/ChronoDepth/。
引用
@article{arxiv.2406.01493,
title = {Learning Temporally Consistent Video Depth from Video Diffusion Priors},
author = {Jiahao Shao and Yuanbo Yang and Hongyu Zhou and Youmin Zhang and Yujun Shen and Vitor Guizilini and Yue Wang and Matteo Poggi and Yiyi Liao},
journal= {arXiv preprint arXiv:2406.01493},
year = {2025}
}