中文

利用跨注意力与对齐音频和文本的多模态语音情感识别

音频与语音处理 2022-07-27 v1 声音

摘要

在本文中,我们提出了一种称为跨注意力网络(CAN)的新型语音情感识别模型,其使用对齐的音频和文本信号作为输入。该方法的灵感来源于人类将语音识别为同时产生的声学与文本信号的组合。首先,我们的方法将音频及其底层文本信号以对齐方式分割为相等步数,使得序列信号的相同时间步覆盖信号中的同一时间跨度。结合此技术,我们应用跨注意力来聚合来自对齐信号的序列信息。在跨注意力中,每种模态通过对各模态施加全局注意力机制被独立聚合。然后,每种模态的注意力权重以交叉方式直接应用于另一模态,使得CAN基于每种模态从相同时间步收集音频和文本信息。在标准IEMOCAP数据集上进行的实验中,我们的模型在加权准确率和未加权准确率上分别相对优于最先进(SOTA)系统2.66%和3.18%。

关键词

引用

@article{arxiv.2207.12895,
  title  = {Multimodal Speech Emotion Recognition using Cross Attention with Aligned Audio and Text},
  author = {Yoonhyung Lee and Seunghyun Yoon and Kyomin Jung},
  journal= {arXiv preprint arXiv:2207.12895},
  year   = {2022}
}

备注

5 pages, accepted by INTERSPEECH 2020