中文

DispSegNet:利用语义信息从立体图像端到端学习视差估计

计算机视觉与模式识别 2019-05-09 v2

摘要

近期工作表明卷积神经网络(CNNs)可成功应用于视差估计,但这些方法在低纹理、遮挡和反射区域仍受误差影响。同时,用于语义分割的深度学习近年来取得了巨大进展。在本文中,我们设计了一种 CNN 架构,将这两项任务结合起来,以借助语义分割提升视差估计的质量与精度。具体而言,我们提出了一种两任务高度耦合的网络结构。该方法的一个关键新颖之处在于两阶段精炼过程。初始视差估计利用从网络语义分割分支学到的嵌入进行精炼。所提模型采用无监督方法进行训练,其中将立体对中一半的图像进行变形并与另一相机图像进行比较。所提方法的另一个关键优势是单一网络能够同时输出视差估计与语义标签。这些输出在自动驾驶车辆运行中极有用处;由于实时性约束是关键,此类性能提升增加了驾驶应用的可行性。在 KITTI 和 Cityscapes 数据集上的实验表明,我们的模型能够取得最先进的结果,且利用从语义分割学到的嵌入可改善视差估计性能。

关键词

引用

@article{arxiv.1809.04734,
  title  = {DispSegNet: Leveraging Semantics for End-to-End Learning of Disparity Estimation from Stereo Imagery},
  author = {Junming Zhang and Katherine A. Skinner and Ram Vasudevan and Matthew Johnson-Roberson},
  journal= {arXiv preprint arXiv:1809.04734},
  year   = {2019}
}

备注

Add more description on the architecture of the model. Add more discussion on section IV-C. Fix typo in formula 6