中文

面向语音情感识别的多任务半监督对抗自编码方法

声音 2020-03-24 v5 音频与语音处理

摘要

尽管语音情感识别(SER)的重要性日益凸显,其当前最优精度仍相当低,需加以改进才能使 SER 的商业应用具备可行性。导致低精度的关键潜在原因是情感数据集的稀缺,这总体上对开发任何鲁棒机器学习模型都构成挑战。本文针对该问题提出一种解决方案:一种利用数据充足可得的辅助任务的多任务学习框架。我们表明,利用这些额外数据可改进仅拥有有限标注数据的 SER 主任务。具体而言,我们采用性别识别与说话人识别作为辅助任务,从而能够使用极大型数据集,例如说话人分类数据集。为最大化多任务学习的收益,我们进一步在框架内使用对抗自编码器(AAE),其具备学习强大且具判别力特征的强能力。此外,无监督 AAE 与有监督分类网络相结合实现了半监督学习,将判别组件引入 AAE 无监督训练流程。该半监督学习从根本上有助于提升框架的泛化能力,从而带来 SER 性能的提升。所提模型在分类与维度情感以及跨语料库场景下均经过严格评估。实验结果表明,所提模型在两个公开数据集上取得了当前最优性能。

关键词

引用

@article{arxiv.1907.06078,
  title  = {Multi-Task Semi-Supervised Adversarial Autoencoding for Speech Emotion Recognition},
  author = {Siddique Latif and Rajib Rana and Sara Khalifa and Raja Jurdak and Julien Epps and Björn W. Schuller},
  journal= {arXiv preprint arXiv:1907.06078},
  year   = {2020}
}

备注

Accepted in IEEE Transactions on Affective Computing