EGFormer:面向高效与可泛化的多模态语义分割
计算机视觉与模式识别
2025-05-21 v1
摘要
近期的研究探索了多模态语义分割方法,然而尽管大多数方法致力于提升精度,其计算效率仍未得到充分关注。为此,我们提出了EGFormer——一个高效的多模态语义分割框架,能够灵活集成任意数量的模态,显著降低模型参数量和推理时间,同时不损失性能。该框架引入两个新模块:首先,任意模态评分模块(Any-modal Scoring Module, ASM)独立为每个模态分配重要性得分,实现基于特征图的动态排序;其次,模态丢弃模块(Modal Dropping Module, MDM)在每个阶段过滤掉信息较少的模态,仅保留并聚合最有价值的特征。通过这种设计,模型能够从所有可用模态中利用有用信息,同时丢弃冗余内容,从而确保高质量的分割结果。除效率外,我们还在合成到真实的迁移任务上评估了EGFormer,以证明其通用性。大量实验表明,EGFormer在实现最高88%参数量减少和50%更少GFLOPs的同时,仍能达到竞争性能。在无监督域适应设置下,其进一步实现了对现有方法的最新传播性能。
引用
@article{arxiv.2505.14014,
title = {EGFormer: Towards Efficient and Generalizable Multimodal Semantic Segmentation},
author = {Zelin Zhang and Tao Zhang and KediLI and Xu Zheng},
journal= {arXiv preprint arXiv:2505.14014},
year = {2025}
}