中文

基于自适应多级因子化双线性池化的视听情感识别注意力网络信息融合

声音 2021-11-18 v1 多媒体 音频与语音处理

摘要

多模态情感识别在情感计算中是一项具有挑战性的任务,因为提取判别性特征以识别具有抽象概念和多种表达的人类情感的细微差异相当困难。此外,如何充分利用音频与视觉信息仍是一个开放问题。本文中,我们提出一种基于自适应和多级因子化双线性池化(FBP)的新型多模态融合注意力网络用于视听情感识别。首先,对于音频流,设计了一个配备一维注意力机制与局部响应归一化的全卷积网络(FCN)用于语音情感识别。接下来,提出一种全局 FBP(G-FBP)方法,通过将从基于自注意力的视频流与所提音频流相整合来实现视听信息融合。为改进 G-FBP,基于各自模态注意力机制得到的与情感相关的表示向量,设计了一种自适应策略(AG-FBP)来动态计算两模态的融合权重。最后,为充分利用局部情感信息,在 AG-FBP 基础上引入自适应多级 FBP(AM-FBP),将一次录音中的全局主干与主干内数据相结合。在仅含音频流的 IEMOCAP 语料库上测试语音情感识别,新 FCN 方法以 71.40% 的准确率优于现有最优结果。此外,在 EmotiW2019 子挑战的 AFEW 数据库与 IEMOCAP 语料库上验证视听情感识别,所提 AM-FBP 方法在测试集上分别取得了 63.09% 和 75.49% 的最佳准确率。

关键词

引用

@article{arxiv.2111.08910,
  title  = {Information Fusion in Attention Networks Using Adaptive and Multi-level Factorized Bilinear Pooling for Audio-visual Emotion Recognition},
  author = {Hengshun Zhou and Jun Du and Yuanyuan Zhang and Qing Wang and Qing-Feng Liu and Chin-Hui Lee},
  journal= {arXiv preprint arXiv:2111.08910},
  year   = {2021}
}