面向多模态语义分割的鲁棒平衡模态贡献
计算机视觉与模式识别
2025-09-30 v1
摘要
多模态语义分割通过利用跨模态互补性来增强模型鲁棒性。然而,现有方法常因模态依赖不平衡而受影响,即当某一主导模态在实际场景中恶化时,整体性能会显著下降。因此,模态平衡已成为实用多模态分割的关键挑战。为此,我们提出 EQUISeg,一种通过等编码模态来平衡模态贡献的多模态分割框架。基于四阶段的 Cross-modal Transformer Block(CMTB),EQUISeg 实现了高效的多模态融合和层次选择。进一步,我们设计了自引导模块(SGM),通过引入相互引导机制来缓解模态不平衡,使每个模态能够自适应调整其贡献,在受损条件下增强鲁棒性。广泛的实验表明,EQUISeg 在多个数据集上实现显著的性能提升,有效缓解了分割任务中模态不平衡的不利影响。
引用
@article{arxiv.2509.24505,
title = {Robust Multimodal Semantic Segmentation with Balanced Modality Contributions},
author = {Jiaqi Tan and Xu Zheng and Fangyu Li and Yang Liu},
journal= {arXiv preprint arXiv:2509.24505},
year = {2025}
}