基于深度 RNN 的开放世界立体视频匹配
计算机视觉与模式识别
2018-08-14 v1
摘要
基于深度学习的立体匹配方法已在不同的基准测试中取得巨大成功并获得顶尖成绩。然而,与大多数数据驱动方法一样,现有的深度立体匹配网络存在一些众所周知的缺陷,例如需要大量带标签的训练数据,且其性能从根本上受限于泛化能力。在本文中,我们提出了一种新颖的循环神经网络(RNN),它以连续的(可能先前未见的)立体视频作为输入,直接预测每一帧的深度图,无需预训练过程,也无需真实深度图作为监督。得益于循环特性(由两个卷积-LSTM 块提供),我们的网络能够记忆并从过往经验中学习,并修改其内部参数(网络权重)以适应先前未见或不熟悉的环境。这表明该网络具有卓越的泛化能力,使其适用于一个{\em 开放世界}设定。我们的方法在场景内容、图像统计、光照和季节条件{\em 等}变化时均能稳健工作。通过大量实验,我们证明了所提方法能在不同场景间无缝适应。同样重要的是,在立体匹配精度方面,它在 KITTI 和 Middlebury 立体等标准基准数据集上优于最先进的深度立体方法。
引用
@article{arxiv.1808.03959,
title = {Open-World Stereo Video Matching with Deep RNN},
author = {Yiran Zhong and Hongdong Li and Yuchao Dai},
journal= {arXiv preprint arXiv:1808.03959},
year = {2018}
}
备注
Accepted by European Conference on Computer Vision (ECCV) 2018