StableDPT: 单目视频深度估计的时序稳定方法
计算机视觉与模式识别
2026-01-07 v1
摘要
将单图像单目深度估计 (MDE) 模型应用于视频序列会引入显著的时序不稳定和闪烁性。我们提出了一种新方法,通过集成一个在单 GPU 上仅需数天即可训练的新型时序模块来适应任何最先进的基于图像的 (深度) 估计模型用于视频处理。我们的架构 StableDPT 基于即插即用的 Vision Transformer (ViT) 编码器,并增强了 Dense Prediction Transformer (DPT) 头。我们的贡献核心在于头中的时序层,它们使用高效的交叉注意力机制整合来自整个视频序列中跨越多个关键帧的信息。这允许模型捕获全局上下文和帧间关系,从而实现更准确且时序更稳定的深度预测。此外,我们提出了一种新颖的推理策略,用于处理任意长度的视频,避免了其他方法使用的重叠窗口所导致的尺度错位和冗余计算。在多个基准数据集上的评估表明,我们在时序一致性方面取得了改进,实现了具竞争力的时序最先进水平,并在实际场景中实现了超过 2 倍的加速。
引用
@article{arxiv.2601.02793,
title = {StableDPT: Temporal Stable Monocular Video Depth Estimation},
author = {Ivan Sobko and Hayko Riemenschneider and Markus Gross and Christopher Schroers},
journal= {arXiv preprint arXiv:2601.02793},
year = {2026}
}