视频深度传递
计算机视觉与模式识别
2025-12-12 v1
摘要
视频深度估计是实施视觉感知的关键任务,但现有方法要么依赖简单逐帧的单目模型,导致时序不一致和不准确;要么采用计算密集的时序建模,难以满足实时需求。这些限制显著削弱了实际场景下的广泛适用性和性能。为此,我们提出 VeloDepth,一个高效稳健的在线视频深度估计管道,有效利用来自前序深度预测的时空先验,并进行深度特征传递。我们引入新颖的传递模块,通过基于流的光流变形耦合学习残差校正,对深度特征和预测进行细化与传递。此外,我们的设计在结构上强制时序一致性,实现连续帧间深度预测的稳定性并提升效率。广泛的零样本评估表明,VeloDepth 在时序一致性方面达到最先进水平,准确率与竞争方法相当,推理速度也显著快于现有视频深度估计器。VeloDepth 提供了一个适用于多样感知任务的实用、高效且精确的实时深度估计解决方案。代码与模型已公开:https://github.com/lpiccinelli-eth/velodepth。
引用
@article{arxiv.2512.10725,
title = {Video Depth Propagation},
author = {Luigi Piccinelli and Thiemo Wandel and Christos Sakaridis and Wim Abbeloos and Luc Van Gool},
journal= {arXiv preprint arXiv:2512.10725},
year = {2025}
}