MTStereo 2.0:基于最大树的立体深度估计精度提升
计算机视觉与模式识别
2020-06-30 v1
摘要
具备高效且精确的从立体图像对中提取深度的能力,是机器人与嵌入式系统等低功耗资源系统所必需的。基于卷积神经网络的最先进立体匹配方法需要在 GPU 上进行密集计算,难以部署于嵌入式系统。本文提出一种名为 MTStereo 2.0 的立体匹配方法,面向需要高效精确深度估计的有限资源系统。该方法基于图像对的最大树(Max-tree)分层表示,借此沿图像扫描线识别匹配区域。方法包含一种代价函数,综合考虑基于最大树的区域上下文信息相似性,以及一种保持视差边界的代价聚合策略。MTStereo 2.0 相较前作 MTStereo 1.0 的改进在于:a) 采用更鲁棒的代价函数,b) 更彻底地检测错误匹配,c) 以像素级而非节点级精度计算视差图。MTStereo 提供精确的稀疏与半稠密深度估计,且不需像基于 CNN 的方法那样进行密集 GPU 计算,因而可在低功耗需求的嵌入式与机器人设备上运行。我们在多个基准数据集(即 KITTI 2015、Driving、FlyingThings3D、Middlebury 2014、Monkaa 及 TrimBot2020 园林数据集)上测试了所提方法,取得了具竞争力的精度与效率。代码见 https://github.com/rbrandt1/MaxTreeS。
引用
@article{arxiv.2006.15373,
title = {MTStereo 2.0: improved accuracy of stereo depth estimation withMax-trees},
author = {Rafael Brandt and Nicola Strisciuglio and Nicolai Petkov},
journal= {arXiv preprint arXiv:2006.15373},
year = {2020}
}