StereoDiff:基于立体匹配与扩散模型的视频深度估计协同
计算机视觉与模式识别
2025-11-11 v3
摘要
最近的视频深度估计方法通过遵循图像深度估计范式(即通常以大量数据微调预训练的视频扩散模型)来实现卓越的性能。然而,我们认为视频深度估计并非图像深度估计的简单延伸。在视频中,动态区域和静态区域的时间一致性要求本质不同。静态区域(通常为背景)的深度一致性可以通过跨所有帧的立体匹配更有效地实现,这提供了更强大的全局三维线索。而动态区域的一致性仍需通过大规模视频深度数据进行学习,以确保平滑的过渡,因为三角测量约束被违反。基于这些见解,我们引入了StereoDiff——一个两阶段的视频深度估计器,通过协同利用静态区域的立体匹配和动态区域的视频深度扩散来保持深度一致性。我们通过频域分析数学地展示了立体匹配和视频深度扩散如何通过互补优势实现协同,突出了其在捕捉两者优势方面的有效性。在零样本、真实世界、动态视频深度基准测试(包括室内和户外)上的实验结果表明,StereoDiff在视频深度估计中实现了SOTA性能,展示了其在一致性和准确性方面的优越性。
引用
@article{arxiv.2506.20756,
title = {StereoDiff: Stereo-Diffusion Synergy for Video Depth Estimation},
author = {Haodong Li and Chen Wang and Jiahui Lei and Kostas Daniilidis and Lingjie Liu},
journal= {arXiv preprint arXiv:2506.20756},
year = {2025}
}
备注
Work done in Nov 2024, during an internship at the University of Pennsylvania. Project page: https://stereodiff.github.io/