中文

MAGIC++:基于层次模态选择的高效鲁棒模态无关语义分割

计算机视觉与模式识别 2024-12-24 v1

摘要

本文针对模态无关语义分割(MaSS)问题进行研究,旨在在每个特征层次上 centering 每一种模态的价值。在实际场景中,对所有可用视觉模态进行训练并有效融合任意组合的模态对于语义分割的鲁棒性至关重要,但迄今为止鲁有探索。现有方法常将RGB置于中心, treating 其他模态为次要,导致架构不对称。然而,在夜间等场景中,RGB单独使用存在局限,事件数据等模态优势明显。因此,必须具备弹性融合模型,能够动态适应每种模态的优势,同时弥补弱输入。为此,我们引入MAGIC++框架,包含两个即插即用模块,用于有效的多模态融合和层次模态选择,可与各种主干模型配合使用。首先,我们引入多模态交互模块,高效处理来自输入多模态批次的特征,并通过通道级和空间级引导提取互补场景信息。此上,提出统一的多尺度任意模态选择模块,将聚合特征作为基准,基于在层次特征空间中的相似性得分对多模态特征进行排序。如此,本方法可在每个特征层次上消除对RGB模态的依赖,更好地克服传感器故障和环境噪声,同时确保分割性能。在常见的多模态设置下,本方法在真实和合成基准测试上实现了最先进的性能。此外,在新颖的模态无关设置下,本方法以显著优势超越先前作品。

关键词

引用

@article{arxiv.2412.16876,
  title  = {MAGIC++: Efficient and Resilient Modality-Agnostic Semantic Segmentation via Hierarchical Modality Selection},
  author = {Xu Zheng and Yuanhuiyi Lyu and Lutao Jiang and Jiazhou Zhou and Lin Wang and Xuming Hu},
  journal= {arXiv preprint arXiv:2412.16876},
  year   = {2024}
}