SOSD-Net:基于单目图像的联合语义目标分割与深度估计网络
计算机视觉与模式识别
2021-01-20 v1
摘要
深度估计与语义分割在场景理解中起着至关重要的作用。最先进的方法采用多任务学习,在像素级同时学习这两个任务的模型。它们通常侧重于共享公共特征或拼接来自相应分支的特征图。然而,这些方法缺乏对几何线索与场景解析相关性的深入考量。本文中,我们首先引入语义目标性(semantic objectness)的概念,通过对成像过程的分析来利用这两个任务间的几何关系,进而基于目标性假设提出语义目标分割与深度估计网络(SOSD-Net)。据我们所知,SOSD-Net 是首个利用几何约束进行同步单目深度估计与语义分割的网络。此外,考虑到这两个任务间相互的隐含关系,我们借鉴期望最大化算法的迭代思想,更有效地训练所提网络。在 Cityscapes 和 NYU v2 数据集上的大量实验结果证明了所提方法的优越性能。
引用
@article{arxiv.2101.07422,
title = {SOSD-Net: Joint Semantic Object Segmentation and Depth Estimation from Monocular images},
author = {Lei He and Jiwen Lu and Guanghui Wang and Shiyu Song and Jie Zhou},
journal= {arXiv preprint arXiv:2101.07422},
year = {2021}
}