中文

基于 ConvNets 的多语言语音通用端到端情感识别

计算与语言 2019-01-28 v1 机器学习 音频与语音处理

摘要

我们提出了一种使用卷积神经网络 (CNN) 处理多种语言的端到端情感识别方法,可应用于语音中的情感和人格识别。我们奠定了同时在多种语言上训练的通用模型的基础。由于情感在所有语言中是共享的,我们能够利用语言之间的共享信息,从而提高每种语言的整体性能。与仅在每种语言上训练的相同模型相比,我们在情感上获得了 12.8% 的平均提升,在人格上获得了 10.1% 的平均提升。它是端到端的,因为我们直接将窄带原始波形作为输入。这使我们能够接受从任何来源录制的音频作为输入,并避免了特征提取的开销和信息丢失。基于 F 分数,它在情感上比使用频谱图作为输入的类似 CNN 高出 12.8%,在人格上高出 6.3%。对网络参数和层激活的分析表明,网络在第一层学习并提取了显著特征,特别是基频、能量和轮廓变化。随后的卷积层则通过分析超分特征捕获特定语言的表示。我们的模型代表了向完全通用的情感识别器发展的重要一步,该识别器能够识别诸如压力等额外描述符,并为未来在情感交互系统中的实现奠定基础。

关键词

引用

@article{arxiv.1901.06486,
  title  = {Towards Universal End-to-End Affect Recognition from Multilingual Speech by ConvNets},
  author = {Dario Bertero and Onno Kampman and Pascale Fung},
  journal= {arXiv preprint arXiv:1901.06486},
  year   = {2019}
}