中文

填补空白:基于多任务混合多尺度生成框架的遥感语义分割缺失模态问题

计算机视觉与模式识别 2025-09-16 v1

摘要

多模态学习在各类领域展现出显著的性能提升,优于普通单模态模型。然而,在实际场景中,由于传感器故障和恶劣天气条件,多模态信号容易出现缺失,这会严重损害模型的运行和性能。诚如 AutoEncoder(AE)和生成对抗网络(GAN)这类生成模型旨在从可用模态重建缺失模态,却在遥感语义分割领域的应用效果仍未得到充分探索。本文首先检视现有生成方法在处理遥感多模态数据异质性方面的局限性。它们在大类内变异大、小类间差异小的复杂场景中,能充分捕获语义上下文的能力不足。此外,传统生成模型高度依赖主导模态,容易引入偏差,影响在缺失模态条件下的模型鲁棒性。为此,本文提出一种新型生成增强多模态学习网络(GEMMNet),包含三个关键组件:(1)混合特征提取器(HyFEx),有效学习模态特定表征;(2)混合融合与多尺度感知(HyFMA),捕获跨尺度的模态协同语义上下文;(3)补充损失(CoLoss)方案,通过鼓励跨模态和跨任务的一致性来缓解固有的偏差。我们的模型 GEMMNet 在两个具有挑战性的遥感语义分割数据集(Vaihingen 和 Potsdam)上,均优于生成基线 AE、cGAN(条件GAN)以及最新非生成方法 mmformer 和 shaspec。源代码已公开。

关键词

引用

@article{arxiv.2509.11102,
  title  = {Filling the Gaps: A Multitask Hybrid Multiscale Generative Framework for Missing Modality in Remote Sensing Semantic Segmentation},
  author = {Nhi Kieu and Kien Nguyen and Arnold Wiliem and Clinton Fookes and Sridha Sridharan},
  journal= {arXiv preprint arXiv:2509.11102},
  year   = {2025}
}

备注

Accepted to DICTA 2025