中文

CoMiX:用于 HSI-X 语义分割的基于可变形卷积的跨模态融合

计算机视觉与模式识别 2024-11-15 v1

摘要

利用补充数据类型(称为 X 模态)的互补信息改进高光谱图像(HSI)语义分割虽具前景,但因成像传感器、图像内容和分辨率的差异而极具挑战。现有技术难以增强模态特有与模态共享信息,亦难以捕捉不同模态间的动态交互与融合。针对该问题,本研究提出 CoMiX,一种采用可变形卷积(DCN)的非对称编码器-解码器架构,用于 HSI-X 语义分割。CoMiX 旨在从 HSI 与 X 数据中提取、校准并融合信息。其流程包含一个具有两个并行交互主干的编码器和一个轻量级全多层感知机(ALL-MLP)解码器。编码器由四个阶段组成,每阶段均包含用于 X 模态的 2D DCN 模块以适应几何变化,以及用于 HSI 的 3D DCN 模块以自适应聚合空间-光谱特征。此外,每阶段还包含一个跨模态特征增强与交换(CMFeX)模块和一个特征融合模块(FFM)。CMFeX 旨在利用不同模态的空间-光谱相关性来重新校准和增强模态特有与模态共享特征,同时自适应地交换互补信息。CMFeX 的输出送入 FFM 进行融合,并传递至下一阶段以进一步学习信息。最终,各 FFM 的输出由 ALL-MLP 解码器整合以得到最终预测。大量实验表明,CoMiX 取得优异性能并能很好地泛化至各类多模态识别任务。CoMiX 代码将予以发布。

关键词

引用

@article{arxiv.2411.09023,
  title  = {CoMiX: Cross-Modal Fusion with Deformable Convolutions for HSI-X Semantic Segmentation},
  author = {Xuming Zhang and Xingfa Gu and Qingjiu Tian and Lorenzo Bruzzone},
  journal= {arXiv preprint arXiv:2411.09023},
  year   = {2024}
}