中文

CrossWeaver:用于任意模态语义分割的跨模态编织

计算机视觉与模式识别 2026-04-06 v1

摘要

多模态语义分割在利用不同感知模态间的互补信息方面展现出巨大潜力。然而,现有方法往往依赖精心设计的融合策略,要么使用模态特定适配,要么依赖松散耦合的交互,从而限制了灵活性并导致跨模态协调效果不佳。此外,这些方法在不同模态组合中往往难以平衡高效信息交换与保持各模态独特特征之间的权衡。为应对这些挑战,我们提出CrossWeaver,一个简单而有效的任意模态语义分割多模态融合框架。其核心是模态交互块(MIB),在编码器中实现选择性和可靠性感知的跨模态交互,而轻量级的 Seam-Aligned Fusion(SAF)模块进一步聚合增强特征。在多个多模态语义分割基准上的广泛实验表明,我们的框架以极少额外参数达到了最先进性能,并对未见模态组合具有强泛化能力。

关键词

引用

@article{arxiv.2604.02948,
  title  = {CrossWeaver: Cross-modal Weaving for Arbitrary-Modality Semantic Segmentation},
  author = {Zelin Zhang and Kedi Li and Huiqi Liang and Tao Zhang and Chuanzhi Xu},
  journal= {arXiv preprint arXiv:2604.02948},
  year   = {2026}
}