中文

SFusion:基于自注意力的N对一多模态融合模块

计算机视觉与模式识别 2023-07-06 v2 人工智能

摘要

人类通过视觉、听觉、嗅觉、触觉等不同感官感知世界。处理并融合来自多种模态的信息,使人工智能更容易理解我们周围的世界。然而,当存在缺失模态时,不同场景下可用模态的数量不同,从而导致N对一的融合问题。为解决该问题,我们提出一种称为SFusion的基于自注意力的融合模块。与预设公式或基于卷积的方法不同,所提模块自动学习融合可用模态,而无需合成或零填充缺失模态。具体而言,将从上游处理模型提取的特征表示投影为令牌并输入自注意力模块,以生成潜在的多模态关联;随后引入模态注意力机制构建共享表示,供下游决策模型使用。所提SFusion可轻松集成到现有多模态分析网络中。本文中,我们将SFusion应用于不同骨干网络以完成人类活动识别与脑肿瘤分割任务。大量实验结果表明,SFusion模块优于对比的融合策略。我们的代码见 https://github.com/scut-cszcl/SFusion。

关键词

引用

@article{arxiv.2208.12776,
  title  = {SFusion: Self-attention based N-to-One Multimodal Fusion Block},
  author = {Zecheng Liu and Jia Wei and Rui Li and Jianlong Zhou},
  journal= {arXiv preprint arXiv:2208.12776},
  year   = {2023}
}

备注

This paper has been accepted by MICCAI 2023