基于自注意力与残差结构的跨模态融合网络用于多模态情感识别
计算机视觉与模式识别
2021-11-04 v1 计算与语言
多媒体
摘要
基于音视频的多模态情感识别因其鲁棒性能而备受关注。现有方法大多侧重于提出不同的跨模态融合策略。然而,这些策略在不同模态的特征中引入了冗余,而未充分考虑模态信息间的互补特性,且这些方法不能保证在模态内和模态间交互过程中原始语义信息不丢失。在本文中,我们提出了一种新颖的基于自注意力与残差结构的跨模态融合网络(CFN-SR)用于多模态情感识别。首先,我们分别通过高效的ResNeXt和一维CNN对音频和视频模态进行表征学习,以获得两种模态的语义特征。其次,我们将两种模态的特征分别送入跨模态块,通过自注意力机制和残差结构确保信息的高效互补与完整。最后,我们通过将获得的融合表征与原始表征拼接来得到情感输出。为验证所提方法的有效性,我们在RAVDESS数据集上进行了实验。实验结果表明,所提出的CFN-SR达到了当前最优水平,以26.30M参数量获得了75.76%的准确率。我们的代码见https://github.com/skeletonNN/CFN-SR。
引用
@article{arxiv.2111.02172,
title = {A cross-modal fusion network based on self-attention and residual structure for multimodal emotion recognition},
author = {Ziwang Fu and Feng Liu and Hanyang Wang and Jiayin Qi and Xiangling Fu and Aimin Zhou and Zhibin Li},
journal= {arXiv preprint arXiv:2111.02172},
year = {2021}
}
备注
5 pages, 1 figure, 2 tables