FutureDepth:通过学习预测未来提升视频深度估计
计算机视觉与模式识别
2025-01-17 v2
摘要
本文提出一种新颖的视频深度估计方法FutureDepth,通过在训练时学习预测未来,使模型能够隐式利用多帧和运动线索来提升深度估计。具体而言,我们提出一个 future prediction network F-Net,该网络接受多个连续帧的特征,并被训练以预测一个时间步-ahead的多帧特征。如此一来,F-Net学习了潜在的运动和对应信息,我们将其特征纳入深度解码过程。此外,为丰富多帧对应线索的学习,我们进一步利用一个 reconstruction network R-Net,通过自适应掩码对多帧特征体进行自编码来进行训练。在推理阶段,F-Net和R-Net用于生成查询信号以配合深度解码器,以及最终的细化网络。通过在多个基准数据集上进行大量实验,即NYUDv2、KITTI、DDAD和Sintel,涵盖室内、驾驶和开放域场景,结果表明FutureDepth在基线模型和现有视频深度估计方法上均显著提升,取得了新的最佳性能 (SOTA)。此外,FutureDepth在能效上也优于现有SOTA视频深度估计模型,与单目模型相当。
引用
@article{arxiv.2403.12953,
title = {FutureDepth: Learning to Predict the Future Improves Video Depth Estimation},
author = {Rajeev Yasarla and Manish Kumar Singh and Hong Cai and Yunxiao Shi and Jisoo Jeong and Yinhao Zhu and Shizhong Han and Risheek Garrepalli and Fatih Porikli},
journal= {arXiv preprint arXiv:2403.12953},
year = {2025}
}
备注
ECCV 2024