中文

NVDS+:面向高效通用视频深度估计的神经稳定器

计算机视觉与模式识别 2024-10-04 v3

摘要

视频深度估计旨在推断时间一致的深度。一种方法是在每个视频上以几何约束微调单图像模型,但被证明效率低下且缺乏鲁棒性。另一种是从数据中学习强制一致性,这需要精心设计的模型与充足的视频深度数据。为应对这两类挑战,我们引入 NVDS+,以即插即用的方式稳定由各类单图像模型估计的不一致深度。我们还精心构建了一个大规模“野外视频深度”(VDW)数据集,包含 14,203 段视频、超过两百万帧,使其成为最大的自然场景视频深度数据集。此外,设计了一种双向推理策略,通过自适应融合前向与后向预测来提升一致性。我们实例化了从小到大型号不等的模型族以适应不同应用。该方法在 VDW 数据集与三个公开基准上进行了评估。为进一步证明通用性,我们将 NVDS+ 扩展至视频语义分割及散景渲染、新视角合成与 3D 重建等若干下游应用。实验结果表明,我们的方法在一致性、准确性与效率上均取得显著提升。本工作为基于学习的视频深度估计提供了坚实的基线数据与数据基础。代码与数据集见:https://github.com/RaymondWang987/NVDS

关键词

引用

@article{arxiv.2307.08695,
  title  = {NVDS+: Towards Efficient and Versatile Neural Stabilizer for Video Depth Estimation},
  author = {Yiran Wang and Min Shi and Jiaqi Li and Chaoyi Hong and Zihao Huang and Juewen Peng and Zhiguo Cao and Jianming Zhang and Ke Xian and Guosheng Lin},
  journal= {arXiv preprint arXiv:2307.08695},
  year   = {2024}
}

备注

V1/V2: ICCV 2023 accepted; V3: the journal extension accepted by IEEE TPAMI 2024