基于定位、激活与锐化的 RGB-T 语义分割
计算机视觉与模式识别
2022-10-27 v1
摘要
语义分割对于场景理解非常重要。为了应对自然图像中恶劣光照条件的场景,引入了热红外(TIR)图像。大多数现有的 RGB-T 语义分割方法遵循三种跨模态融合范式,即编码器融合、解码器融合和特征融合。然而,一些方法忽略了 RGB 和 TIR 特征的属性或不同层级特征的属性。在本文中,我们提出了一种用于 RGB-T 语义分割的基于特征融合的新型网络,命名为 \emph{LASNet},它遵循定位、激活和锐化三个步骤。LASNet 的亮点在于我们充分考虑了不同层级跨模态特征的特点,并相应地提出了三个特定模块以实现更好的分割。具体而言,我们针对高级语义特征提出了一个协同定位模块(CLM),旨在定位所有潜在目标。我们针对中级特征提出了一个互补激活模块,旨在激活不同目标的精确区域。我们针对低级纹理特征提出了一个边缘锐化模块(ESM),旨在锐化目标的边缘。此外,在训练阶段,我们在 CLM 和 ESM 之后分别附加了定位监督和边缘监督,并在解码器部分施加了两个语义监督以促进网络收敛。在两个公开数据集上的实验结果证明了我们的 LASNet 优于相关 SOTA 方法。我们方法的代码和结果可在 https://github.com/MathLee/LASNet 获取。
引用
@article{arxiv.2210.14530,
title = {RGB-T Semantic Segmentation with Location, Activation, and Sharpening},
author = {Gongyang Li and Yike Wang and Zhi Liu and Xinpeng Zhang and Dan Zeng},
journal= {arXiv preprint arXiv:2210.14530},
year = {2022}
}
备注
12 pages, 7 figures, Accepted by IEEE Transactions on Circuits and Systems for Video Technology 2022