中文

面向跨语言语音情感识别的无监督对抗域适应

声音 2020-07-29 v4 音频与语音处理

摘要

跨语言语音情感识别(SER)对许多实际应用至关重要。SER 系统的性能常因训练与测试数据分布差异而下降。当训练与测试数据属于不同语言时,这些差异更为显著,导致验证与测试分数间存在显著性能差距。构建更鲁棒的模型以适配 SER 系统实际应用势在必行。因此,本文提出一种基于生成对抗网络(GAN)的多语言 SER 模型。我们选用 GAN 是受其学习底层数据分布巨大成功的启发。所提模型设计为目标是在无需目标语言数据标签的情况下学习语言不变表示。我们在四种不同语言情感数据集上评估所提模型,包括一个乌尔都语数据集,以纳入难以获取标签且主流学界研究较少的替代语言。我们的结果表明,所提模型可在无需任何标签的情况下,对所有考虑的数据集(包括非主流乌尔都语数据)显著改进基线跨语言 SER 性能。

关键词

引用

@article{arxiv.1907.06083,
  title  = {Unsupervised Adversarial Domain Adaptation for Cross-Lingual Speech Emotion Recognition},
  author = {Siddique Latif and Junaid Qadir and Muhammad Bilal},
  journal= {arXiv preprint arXiv:1907.06083},
  year   = {2020}
}

备注

Accepted in Affective Computing & Intelligent Interaction (ACII 2019)