用于 RGB-T 语义分割的上下文感知交互网络
计算机视觉与模式识别
2024-01-04 v1
摘要
RGB-T 语义分割是自动驾驶场景理解的一项关键技术。然而,对于现有的 RGB-T 语义分割方法,在多层级间的信息交互中并未实现对不同模态间互补关系的有效探索。为解决这一问题,我们提出了用于 RGB-T 语义分割的上下文感知交互网络(CAINet),该网络构建交互空间以利用辅助任务和全局上下文进行显式引导学习。具体来说,我们提出了一个上下文感知互补推理(CACR)模块,旨在利用空间和通道维度上的长期上下文建立多模态特征间的互补关系。此外,考虑到全局上下文和细节信息的重要性,我们提出了全局上下文建模(GCM)模块和细节聚合(DA)模块,并引入了特定的辅助监督来显式引导上下文交互并细化分割图。在 MFNet 和 PST900 两个基准数据集上的大量实验表明,所提出的 CAINet 达到了最先进的性能。代码可在 https://github.com/YingLv1106/CAINet 获取。
引用
@article{arxiv.2401.01624,
title = {Context-Aware Interaction Network for RGB-T Semantic Segmentation},
author = {Ying Lv and Zhi Liu and Gongyang Li},
journal= {arXiv preprint arXiv:2401.01624},
year = {2024}
}
备注
13 pages, 7 figures, Accepted by IEEE Transactions on Multimedia 2024