中文

面向语音情感识别的域对抗方法

音频与语音处理 2023-05-15 v1 声音

摘要

语音情感识别的性能受到用于构建和评估模型的训练集(源域)与测试集(目标域)之间数据分布差异的影响。这是一个常见问题,因为多项研究表明,当情感分类器暴露于与构建该分类器所用分布不匹配的数据时,其性能会下降。当训练与测试数据来自不同域时,数据分布的差异变得非常明显,导致验证性能与测试性能之间存在巨大差距。由于标注新数据的成本高昂且未标注数据丰富,从可用的未标注数据中尽可能提取有用信息至关重要。本研究探讨了对抗多任务训练在提取训练域与测试域之间公共表示方面的应用。主要任务是预测唤醒度、效价或支配度的基于情感属性的描述符。次要任务是学习一种无法区分训练域与测试域的公共表示。通过使用梯度反转层,来自域分类器的梯度被用于拉近源域和目标域的表示。我们表明,利用未标注数据始终能在所有情感维度上带来更好的情感识别性能。我们可视化了所提出的深度学习架构中对抗训练对特征表示的影响。分析显示,随着数据传入网络更深的层,训练域和测试域的数据表示趋于收敛。我们还评估了使用浅层神经网络与深度神经网络(DNN)时的性能差异,以及任务分类器和域分类器所用共享层数量的影响。

关键词

引用

@article{arxiv.1804.07690,
  title  = {Domain Adversarial for Acoustic Emotion Recognition},
  author = {Mohammed Abdelwahab and Carlos Busso},
  journal= {arXiv preprint arXiv:1804.07690},
  year   = {2023}
}

备注

submitted to IEEE transactions on signal processing