中文

利用时间一致性实现实时视频深度估计

计算机视觉与模式识别 2019-08-13 v1

摘要

近年来,通过利用深度卷积神经网络(CNNs)的分层特征,基于静态图像的深度估计精度得到了显著提升。与静态图像相比,视频帧之间存在大量信息,可用于提升深度估计性能。本工作中,我们专注于从单目视频中探索时间信息以进行深度估计。具体而言,我们利用卷积长短期记忆(CLSTM)的优势,提出了一种新颖的时空 CSLTM(ST-CLSTM)结构。我们的 ST-CLSTM 结构不仅能捕获空间特征,还能以可忽略的计算代价增加捕获连续视频帧间的时间相关性/一致性。此外,为保持估计深度帧间的时间一致性,我们采用生成对抗学习方案并设计了一种时间一致性损失。该时间一致性损失与空间损失结合,以端到端方式更新模型。借助时间信息,我们构建了一个实时运行且生成视觉愉悦结果的视频深度估计框架。此外,我们的方法灵活,可推广至大多数现有深度估计框架。代码见:https://tinyurl.com/STCLSTM

关键词

引用

@article{arxiv.1908.03706,
  title  = {Exploiting temporal consistency for real-time video depth estimation},
  author = {Haokui Zhang and Chunhua Shen and Ying Li and Yuanzhouhan Cao and Yu Liu and Youliang Yan},
  journal= {arXiv preprint arXiv:1908.03706},
  year   = {2019}
}

备注

Accepted to Proc. Int. Conf. Computer Vision 2019