重新定位每个模态的数值:面向高效韧性模态无关语义分割的方法
计算机视觉与模式识别
2024-08-27 v2
摘要
对任意模态数的融合对于实现语义分割的稳健多模态融合至关重要,但迄今为止鲜有探索。近期研究将RGB模态视为中心,其余模态视为辅助,导致非对称的双分支架构。然而,RGB模态在夜间等场景下可能不足,而事件数据等其他模态各有优势;因此,融合模型必须辨识稳健与脆弱模态,纳入最稳健与最脆弱的模态以构建韧性的多模态框架。为此,我们提出一种新方法MAGIC,可灵活搭配各种主干网络,从紧凑型到高性能模型不等。该方法包含两个关键即插即用模块:首先引入多模态聚合模块高效处理多模态特征并提取互补场景信息;随后提出统一的任意模态选择模块,以聚合特征为基准对多模态特征的相似度得分进行排序。如此,本方法可摆脱对RGB模态的依赖,更好地应对传感器故障,同时保持分割性能。 在常用的多模态设置下,本方法实现了最先进的性能,模型参数减少60%。此外,在新颖的模态无关设置下,本方法以+19.41% mIoU的优势超过前人。
引用
@article{arxiv.2407.11344,
title = {Centering the Value of Every Modality: Towards Efficient and Resilient Modality-agnostic Semantic Segmentation},
author = {Xu Zheng and Yuanhuiyi Lyu and Jiazhou Zhou and Lin Wang},
journal= {arXiv preprint arXiv:2407.11344},
year = {2024}
}
备注
Accepted to ECCV 2024