少即是多:基于掩码帧建模的一致视频深度估计
计算机视觉与模式识别
2022-08-19 v2
摘要
时间一致性是视频深度估计的关键挑战。先前的工作基于额外的光流或相机位姿,较为耗时。相比之下,我们以更少的信息推导一致性。由于视频本身存在严重的时间冗余,缺失帧可由相邻帧恢复。受此启发,我们提出帧掩码网络(FMNet),一种基于相邻帧预测掩码帧深度的时空 transformer 网络。通过重建掩码的时间特征,FMNet 能够学习帧间内在相关性,从而实现一致性。与先前方法相比,实验结果表明我们的方法在无需任何额外信息的情况下取得了可比的空间精度与更高的时间一致性。我们的工作为一致视频深度估计提供了新视角。我们的官方项目页面为 https://github.com/RaymondWang987/FMNet。
引用
@article{arxiv.2208.00380,
title = {Less is More: Consistent Video Depth Estimation with Masked Frames Modeling},
author = {Yiran Wang and Zhiyu Pan and Xingyi Li and Zhiguo Cao and Ke Xian and Jianming Zhang},
journal= {arXiv preprint arXiv:2208.00380},
year = {2022}
}
备注
Accepted by ACM MM 2022