中文

从原始语音直接建模语音情感

声音 2020-07-29 v4 音频与语音处理

摘要

语音情感识别是一项具有挑战性的任务,严重依赖于手工设计的声学特征,这些特征通常是为了呼应人类对语音信号的感知而精心构建的。然而,从感知证据设计的滤波器组并不总能在以情感分类为最终目标的统计建模框架中保证最优。这推动了从原始语音中学习表征的新兴趋势,尤其是使用深度学习神经网络。特别地,卷积神经网络(CNN)与长短期记忆网络(LSTM)的组合因 LSTM 在学习对情感识别至关重要的上下文信息方面的内在特性,以及 CNN 克服常规神经网络可扩展性问题的能力而获得了广泛关注。在本文中,我们表明通过利用 CNN 在建模上下文信息方面的特性,仍存在提升从原始语音进行情感识别性能的机会。我们提出使用并行卷积层在特征提取块中利用多种时间分辨率,该提取块与基于 LSTM 的分类网络联合训练以完成情感识别任务。我们的结果表明,所提模型能够达到使用手工设计特征训练的 CNN 在 IEMOCAP 和 MSP-IMPROV 数据集上的性能。

关键词

引用

@article{arxiv.1904.03833,
  title  = {Direct Modelling of Speech Emotion from Raw Speech},
  author = {Siddique Latif and Rajib Rana and Sara Khalifa and Raja Jurdak and Julien Epps},
  journal= {arXiv preprint arXiv:1904.03833},
  year   = {2020}
}

备注

INTERSPEECH 2019