中文

AMMNet:一种用于遥感语义分割的非对称多模态网络

计算机视觉与模式识别 2025-07-23 v1

摘要

随着多模态数据的引入,特别是 RGB 图像与数字表面模型(DSM)的融合——后者提供了关于地面目标的互补上下文与结构信息——遥感(RS)语义分割取得了显著进展。然而,RGB 与 DSM 的融合通常面临两大主要局限:架构冗余导致的计算复杂度增加,以及模态未对齐导致的分割性能下降。这些问题削弱了语义分割的效率与鲁棒性,尤其在需要精确多模态融合的复杂城市环境中更为突出。为克服这些局限,我们提出了非对称多模态网络(AMMNet),这是一种新颖的非对称架构,通过针对 RGB-DSM 输入对定制的三项设计来实现鲁棒且高效的语义分割。为减少架构冗余,非对称双编码器(ADE)模块根据模态特定特征分配表示能力,对 RGB 图像采用更深的编码器以捕获丰富的上下文信息,对 DSM 采用轻量级编码器以提取稀疏结构特征。此外,为促进模态对齐,非对称先验融合器(APF)将模态感知先验矩阵整合至融合过程中,从而生成结构感知的上下文特征。另外,分布对齐(DA)模块通过散度最小化对齐特征分布,增强了跨模态兼容性。在 ISPRS Vaihingen 和 Potsdam 数据集上的大量实验表明,AMMNet 在多模态网络中实现了 SOTA 分割精度,同时降低了计算与内存需求。

关键词

引用

@article{arxiv.2507.16158,
  title  = {AMMNet: An Asymmetric Multi-Modal Network for Remote Sensing Semantic Segmentation},
  author = {Hui Ye and Haodong Chen and Zeke Zexi Hu and Xiaoming Chen and Yuk Ying Chung},
  journal= {arXiv preprint arXiv:2507.16158},
  year   = {2025}
}