中文

面向语音情感识别的说话人不变表示对抗学习

音频与语音处理 2019-03-25 v1 声音

摘要

由于对具备情感智能的语音接口的高需求,语音情感识别(SER)近年来引起了极大关注。为语音情感识别推导说话人不变表示至关重要。本文中,我们提出将对抗训练应用于SER以学习说话人不变表示。我们的模型由三部分组成:带有时间延迟神经网络(TDNN)和统计池化LSTM的表示学习子网络、一个情感分类网络和一个说话人分类网络。情感与说话人分类网络均以表示学习网络的输出作为输入。采用了两种训练策略:一种基于域对抗训练(DAT),另一种基于交叉梯度训练(CGT)。除常规数据集外,我们还在具有250名说话人的更大规模公开可用情感数据集上评估了所提模型。评估结果表明,在IEMOCAP上,DAT和CGT相较于无说话人不变表示学习的基线系统,在5折交叉验证下分别提供了5.6%和7.4%的提升。在更大的情感数据集上,尽管CGT未能取得优于基线的结果,DAT仍能在独立测试集上提供9.8%的相对提升。

关键词

引用

@article{arxiv.1903.09606,
  title  = {Towards adversarial learning of speaker-invariant representation for speech emotion recognition},
  author = {Ming Tu and Yun Tang and Jing Huang and Xiaodong He and Bowen Zhou},
  journal= {arXiv preprint arXiv:1903.09606},
  year   = {2019}
}