用于语音情感识别的多模态注意力
音频与语音处理
2020-09-10 v1 多媒体
声音
图像与视频处理
摘要
情感是人类语音中由言语韵律体现的基本方面。语音、视觉与文本线索在人类交流中互为补充。本文研究一种称为多模态注意力网络(MMAN)的混合融合方法,以利用视觉与文本线索进行语音情感识别。我们提出一种新颖的多模态注意力机制 cLSTM-MMA,其促进三模态间的注意力并选择性融合信息。cLSTM-MMA 在后期融合中与其他单模态子网络融合。实验表明,语音情感识别显著受益于视觉与文本线索,且所提 cLSTM-MMA 单独使用在准确率上与其他融合方法相当,但网络结构紧凑得多。所提混合网络 MMAN 在 IEMOCAP 数据库上取得了语音情感识别的当前最优性能。
引用
@article{arxiv.2009.04107,
title = {Multi-modal Attention for Speech Emotion Recognition},
author = {Zexu Pan and Zhaojie Luo and Jichen Yang and Haizhou Li},
journal= {arXiv preprint arXiv:2009.04107},
year = {2020}
}
备注
Accepted by Interspeech2020