面向语义分割的张量低秩重建
计算机视觉与模式识别
2020-08-04 v1
摘要
上下文信息在语义分割的成功中起着不可或缺的作用。近来,基于非局部自注意力的方法被证明对收集上下文信息有效。由于所需的上下文由空间维和通道维注意力组成,3D表示是一种合适的表述。然而,这些非局部方法基于2D相似度矩阵描述3D上下文信息,其中空间压缩可能导致通道维注意力缺失。另一种方法是在不压缩的情况下直接建模上下文信息。然而,这一尝试面临一个根本困难,即上下文信息的高秩特性。在本文中,我们提出一种建模3D上下文表示的新方法,其不仅避免空间压缩,而且解决了高秩困难。此处,受张量典范多元分解理论(即高秩张量可表示为若干秩-1张量的组合)启发,我们设计了一个低秩到高秩的上下文重建框架(即RecoNet)。具体而言,我们首先引入张量生成模块(TGM),其生成若干秩-1张量以捕获上下文特征的片段。然后我们利用这些秩-1张量通过我们提出的张量重建模块(TRM)恢复高秩上下文特征。大量实验表明,我们的方法在各种公开数据集上达到了最先进水平。此外,与传统的基于非局部的方法相比,我们提出的方法计算代价减少了100倍以上。
引用
@article{arxiv.2008.00490,
title = {Tensor Low-Rank Reconstruction for Semantic Segmentation},
author = {Wanli Chen and Xinge Zhu and Ruoqi Sun and Junjun He and Ruiyu Li and Xiaoyong Shen and Bei Yu},
journal= {arXiv preprint arXiv:2008.00490},
year = {2020}
}
备注
ECCV2020. Top-1 performance on PASCAL-VOC12; Source code at https://github.com/CWanli/RecoNet.git