中文

在线视频深度估计:低内存消耗的时间一致性深度预测

计算机视觉与模式识别 2025-10-13 v1

摘要

从单目视频进行深度估计已成为许多现实世界计算机视觉系统的关键组成部分。最近,Video Depth Anything (VDA) 在长视频序列上展示了强大的性能。然而,它依赖于批处理,这阻碍了其在在线场景中的使用。在这项工作中,我们克服了这一限制,并引入了在线 VDA (oVDA)。关键的创新在于采用了来自大型语言模型 (LLM) 的技术,即在推理期间缓存潜在特征并在训练期间对帧进行掩码。我们的 oVDA 方法在准确性和 VRAM 使用率方面均优于所有竞争的在线视频深度估计方法。低 VRAM 使用率对于在边缘设备上部署尤为重要。我们证明,oVDA 在 NVIDIA A100 上以 42 FPS 运行,在 NVIDIA Jetson 边缘设备上以 20 FPS 运行。我们将发布代码和编译脚本,使 oVDA 易于在低功耗硬件上部署。

关键词

引用

@article{arxiv.2510.09182,
  title  = {Online Video Depth Anything: Temporally-Consistent Depth Prediction with Low Memory Consumption},
  author = {Johann-Friedrich Feiden and Tim Küchler and Denis Zavadski and Bogdan Savchynskyy and Carsten Rother},
  journal= {arXiv preprint arXiv:2510.09182},
  year   = {2025}
}