中文

用于语音情感识别的多模态注意力

音频与语音处理 2020-09-10 v1 多媒体 声音 图像与视频处理

摘要

情感是人类语音中由言语韵律体现的基本方面。语音、视觉与文本线索在人类交流中互为补充。本文研究一种称为多模态注意力网络(MMAN)的混合融合方法,以利用视觉与文本线索进行语音情感识别。我们提出一种新颖的多模态注意力机制 cLSTM-MMA,其促进三模态间的注意力并选择性融合信息。cLSTM-MMA 在后期融合中与其他单模态子网络融合。实验表明,语音情感识别显著受益于视觉与文本线索,且所提 cLSTM-MMA 单独使用在准确率上与其他融合方法相当,但网络结构紧凑得多。所提混合网络 MMAN 在 IEMOCAP 数据库上取得了语音情感识别的当前最优性能。

关键词

引用

@article{arxiv.2009.04107,
  title  = {Multi-modal Attention for Speech Emotion Recognition},
  author = {Zexu Pan and Zhaojie Luo and Jichen Yang and Haizhou Li},
  journal= {arXiv preprint arXiv:2009.04107},
  year   = {2020}
}

备注

Accepted by Interspeech2020