面向多模态遥感语义分割的参数高效模态均衡对称融合
计算机视觉与模式识别
2026-03-19 v1
摘要
多模态遥感语义分割通过挖掘异构数据的互补物理线索来增强场景解释。虽然预训练的视觉基础模型(VFMs)提供了强大的通用表征,但将其适用于多模态任务往往造成计算开销巨大且易产生模态不平衡问题,即辅助模态在优化过程中被抑制。为此本文提出MoBaNet,一个参数高效且模态均衡的对称融合框架。基于大量冻结的VFM主干网络,MoBaNet采用对称双流架构以保留可泛化的表征,同时最小化可训练参数。具体而言,我们设计交叉模态提示注入适配器(CPIA),通过生成共享提示并注入主干网络中的瓶颈适配器,实现深层语义交互。为获得紧凑且判别性的多模态表征用于解码,进一步引入差异导引门控融合模块(DGFM),显式利用跨模态差异引导特征选择,以自适应方式融合配对阶段特征。此外,我们提出模态条件随机遮蔽(MCRM)策略,通过仅在训练时遮蔽一种模态并在模态特定分支上施加硬像素辅助监督,缓解模态不平衡。大量实验表明,在ISPRS Vaihingen和Potsdam基准数据集上,MoBaNet以显著更少的可训练参数实现了状态最佳性能,验证了其对稳健且均衡的多模态融合的有效性。本文的代码已公开于https://github.com/sauryeo/MoBaNet。
引用
@article{arxiv.2603.17705,
title = {Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation},
author = {Haocheng Li and Juepeng Zheng and Shuangxi Miao and Ruibo Lu and Guosheng Cai and Haohuan Fu and Jianxi Huang},
journal= {arXiv preprint arXiv:2603.17705},
year = {2026}
}
备注
14 pages, 6 figures