DeepVideoMVS:基于循环时空融合的视频多视立体匹配
计算机视觉与模式识别
2021-07-23 v3 机器学习
摘要
我们提出了一种针对已标定视频流的在线多视深度预测方法,其中先前时间步计算的场景几何信息以高效且几何合理的方式传播到当前时间步。我们方法的主干是一个实时可用的轻量级编码器-解码器,其依赖于由图像对计算得到的代价体。我们通过在该瓶颈层放置一个 ConvLSTM 单元来扩展它,该单元在其状态中压缩任意数量的过去信息。新颖之处在于通过考虑时间步之间的视角变化来传播该单元隐藏状态。在给定时间步,我们使用先前的深度预测将先前的隐藏状态扭曲到当前相机平面。我们的扩展仅带来很小的计算时间和内存消耗开销,同时显著改善了深度预测。因此,我们在数百个室内场景的大多数评估指标上优于现有的最先进多视立体方法,同时保持实时性能。代码可用:https://github.com/ardaduz/deep-video-mvs
引用
@article{arxiv.2012.02177,
title = {DeepVideoMVS: Multi-View Stereo on Video with Recurrent Spatio-Temporal Fusion},
author = {Arda Düzçeker and Silvano Galliani and Christoph Vogel and Pablo Speciale and Mihai Dusmanu and Marc Pollefeys},
journal= {arXiv preprint arXiv:2012.02177},
year = {2021}
}
备注
CVPR 2021