中文

基于多模态注意力的融合模型用于 RGB-深度图像语义分割

计算机视觉与模式识别 2019-12-30 v1 多媒体

摘要

三维场景理解主要被视为计算机视觉与机器人应用中的关键需求。三维场景理解中的高层任务之一是 RGB-深度图像的语义分割。随着 RGB-D 相机的可用,期望通过利用深度特征与表观特征来提升场景理解过程的精度。由于深度图像独立于光照,它们可与 RGB 图像一起改善语义标注的质量。考虑这两种模态的共同与特定特征可提升语义分割性能。RGB-深度语义分割的主要问题之一是如何融合或组合这两种模态,以在计算高效的同时获得各自模态的更多优势。近来,采用深度卷积神经网络的方法通过早期、晚期与中期融合策略达到了最先进的结果。本文提出一种带基于注意力的融合模块的高效编码器-解码器模型,以整合这两种模态特征图之间的相互影响。该模块显式提取这些模态拼接特征图间的相互依赖关系,从而利用 RGB-深度图像中更强大的特征图。在 NYU-V2、SUN RGB-D 与 Stanford 2D-3D-Semantic 三个主要挑战性数据集上的大量实验结果表明,所提网络在计算成本与模型尺寸方面均优于最先进的模型。实验结果也说明了所提轻量级基于注意力的融合模型在精度上的有效性。

关键词

引用

@article{arxiv.1912.11691,
  title  = {Multi-Modal Attention-based Fusion Model for Semantic Segmentation of RGB-Depth Images},
  author = {Fahimeh Fooladgar and Shohreh Kasaei},
  journal= {arXiv preprint arXiv:1912.11691},
  year   = {2019}
}