中文

基于端到端ASR模型预训练特征的语音情感分析

计算与语言 2020-03-06 v2 机器学习 音频与语音处理

摘要

在本文中,我们提出使用端到端ASR模型的预训练特征,将语音情感分析作为一个下游任务来解决。我们表明,融合了语音中声学与文本信息的端到端ASR特征取得了有前景的结果。我们使用带自注意力的RNN作为情感分类器,其还通过注意力权重提供简便的可视化,以帮助解释模型预测。我们使用经过充分基准测试的IEMOCAP数据集和一个新的大规模语音情感数据集SWBD-sentiment进行评估。我们的方法在IEMOCAP上将最先进准确率从66.6%提升至71.7%,并在包含超过49,500条话语的SWBD-sentiment上达到70.10%的准确率。

关键词

引用

@article{arxiv.1911.09762,
  title  = {Speech Sentiment Analysis via Pre-trained Features from End-to-end ASR Models},
  author = {Zhiyun Lu and Liangliang Cao and Yu Zhang and Chung-Cheng Chiu and James Fan},
  journal= {arXiv preprint arXiv:1911.09762},
  year   = {2020}
}