LSTM-CF:利用LSTM统一上下文建模与融合的RGB-D场景标注
计算机视觉与模式识别
2016-07-27 v3 神经与进化计算
摘要
RGB-D场景的语义标注对包括感知机器人在内的许多智能应用至关重要。它从同时感知的光度(RGB)和深度通道生成逐像素的细粒度标签图。本文通过以下方式解决该问题:i)开发一种新颖的长短期记忆上下文融合(LSTM-CF)模型,该模型捕获并融合来自光度与深度数据多通道的上下文信息;ii)将该模型嵌入深度卷积神经网络(CNN)以实现端到端训练。具体而言,光度与深度通道中的上下文分别通过堆叠若干卷积层和一个长短期记忆层来捕获;该记忆层沿垂直方向编码图像中短程和长程空间依赖关系。另设立一个长短期记忆融合层,用于沿垂直方向整合来自不同通道的上下文,并沿水平方向对融合后的垂直上下文进行双向传播,从而获得真正的2D全局上下文。最后,将融合后的上下文表示与从光度通道提取的卷积特征拼接,以提高细尺度语义标注的准确性。我们提出的模型刷新了最先进水平(SOTA),即在大规模SUNRGBD数据集和NYUDv2数据集上分别取得了37类平均类别准确率48.1%和49.4%(提升了2.2%和5.4%)。
引用
@article{arxiv.1604.05000,
title = {LSTM-CF: Unifying Context Modeling and Fusion with LSTMs for RGB-D Scene Labeling},
author = {Zhen Li and Yukang Gan and Xiaodan Liang and Yizhou Yu and Hui Cheng and Liang Lin},
journal= {arXiv preprint arXiv:1604.05000},
year = {2016}
}
备注
17 pages, accepted by ECCV