带透视理解的循环场景解析
计算机视觉与模式识别
2017-12-07 v2
摘要
物体在场景的透视图像中可能以任意尺度出现,这对以固定分辨率处理图像的识别系统构成挑战。我们提出一个深度感知门控模块,该模块根据物体尺度(与深度成反比)自适应地选择卷积网络架构中的池化域大小,从而为远处物体保留小细节,而对近处物体使用更大的感受野。深度门控信号由立体视差提供或直接从单目输入估计。我们将此深度感知门控集成到循环卷积神经网络中以执行语义分割。我们的循环模块利用先前迭代的深度和语义预测,迭代地细化分割结果。通过在四个流行的大规模RGB-D数据集上的大量实验,我们证明该方法以更为紧凑的模型实现了有竞争力的语义分割性能。我们对该架构进行了广泛分析,包括在单目RGB上运行但在训练期间使用深度作为辅助信息的变体、作为通用注意力机制的无监督门控以及多分辨率门控。我们发现,用于联合语义分割和深度的门控池化在定量单目深度估计上取得了最先进的结果。
引用
@article{arxiv.1705.07238,
title = {Recurrent Scene Parsing with Perspective Understanding in the Loop},
author = {Shu Kong and Charless Fowlkes},
journal= {arXiv preprint arXiv:1705.07238},
year = {2017}
}