中文

用于HSI-X语义分割的局部到全局跨模态注意力感知融合

计算机视觉与模式识别 2024-06-26 v1

摘要

高光谱图像(HSI)分类最近已达到其性能瓶颈。多模态数据融合作为一种有前景的方法正在兴起,通过从补充模态(X模态)提供丰富的互补信息来克服这一瓶颈。然而,由于不同模态的成像传感器、分辨率和内容的差异,实现可以跨不同传感模态泛化的全面跨模态交互和融合是具有挑战性的。在本研究中,我们提出了一个用于HSI-X分类的局部到全局跨模态注意力感知融合(LoGoCAF)框架,该框架同时考虑了效率、准确性和泛化能力。LoGoCAF采用像素到像素的双分支语义分割架构来学习来自HSI和X模态的信息。LoGoCAF的流程由一个局部到全局编码器和一个轻量级多层感知机(MLP)解码器组成。在编码器中,卷积用于在浅层编码局部和高分辨率的精细细节,而Transformer用于在更深层整合全局和低分辨率的粗糙特征。MLP解码器聚合来自编码器的信息以进行特征融合和预测。特别地,在每个编码器阶段引入了两个跨模态模块:特征增强模块(FEM)和特征交互与融合模块(FIFM)。FEM用于通过结合来自另一模态的、跨方向感知、位置敏感和通道维度的特征来增强互补信息。利用增强后的特征,FIFM被设计用于促进跨模态信息交互和融合,以进行最终的语义预测。大量实验表明,我们的LoGoCAF实现了优越的性能并具有良好的泛化能力。代码将公开提供。

关键词

引用

@article{arxiv.2406.17679,
  title  = {Local-to-Global Cross-Modal Attention-Aware Fusion for HSI-X Semantic Segmentation},
  author = {Xuming Zhang and Naoto Yokoya and Xingfa Gu and Qingjiu Tian and Lorenzo Bruzzone},
  journal= {arXiv preprint arXiv:2406.17679},
  year   = {2024}
}