中文

CTA-RNN:利用预训练ASR嵌入的通道与时序注意力RNN用于语音情感识别

声音 2022-04-01 v1 机器学习 音频与语音处理

摘要

先前的研究已探索利用语音的声学和语言线索来改进语音情感识别(SER)的方法。然而,最先进的ASR模型与SER任务之间的潜在关联仍有待探究。本文中,我们提出一种基于预训练ASR模型中间表示的新型通道与时序注意力RNN(CTA-RNN)架构。具体而言,大规模预训练端到端ASR编码器的嵌入同时包含声学和语言信息,以及泛化至不同说话人的能力,使其非常适用于下游SER任务。为进一步利用ASR编码器不同层的嵌入,我们提出一种新型CTA-RNN架构,以在通道和时序两个方向上捕捉嵌入中的情感显著部分。我们在两个流行的基准数据集IEMOCAP和MSP-IMPROV上,采用语料内和跨语料设置评估了我们的方法。实验结果表明,所提方法在准确率和鲁棒性方面均取得了优异性能。

关键词

引用

@article{arxiv.2203.17023,
  title  = {CTA-RNN: Channel and Temporal-wise Attention RNN Leveraging Pre-trained ASR Embeddings for Speech Emotion Recognition},
  author = {Chengxin Chen and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2203.17023},
  year   = {2022}
}

备注

5 pages, 2 figures, submitted to INTERSPEECH 2022