通过语义对齐与跨模态残差学习提升音视频脉冲神经网络
计算机视觉与模式识别
2025-02-19 v1
摘要
人类通过整合来自多个感官信息(如视觉和听觉)来解释和感知世界。作为受脑启发的计算模型,脉冲神经网络(SNN)在模拟大脑信息处理机制方面展现出独特优势。然而,现有SNN模型主要关注单模态处理,缺乏有效的跨模态信息融合,限制了其在现实世界多模态场景中的效能。为此,我们提出了一种语义对齐跨模态残差学习(S-CMRL)框架,是一个基于Transformer的多模态SNN架构,用于有效的音视频集成。S-CMRL利用时空脉冲注意力机制提取跨模态的互补特征,并纳入跨模态残差学习策略以增强特征集成。此外,引入语义对齐优化机制,将跨模态特征在共享语义空间中对齐,从而提高其一致性和互补性。在CREMA-D、UrbanSound8K-AV 和 MNISTDVS-NTIDIGITS 三个基准数据集上的大规模实验表明,S-CMRL显著优于现有多模态SNN方法,实现了最先进的性能。代码已公开于 https://github.com/Brain-Cog-Lab/S-CMRL。
引用
@article{arxiv.2502.12488,
title = {Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning},
author = {Xiang He and Dongcheng Zhao and Yiting Dong and Guobin Shen and Xin Yang and Yi Zeng},
journal= {arXiv preprint arXiv:2502.12488},
year = {2025}
}
备注
The manuscript is under review and the code is available https://github.com/Brain-Cog-Lab/S-CMRL