中文

由三元组损失引导的生成式数据增强用于语音情感识别

声音 2022-08-11 v1 音频与语音处理

摘要

语音情感识别(SER)对人机交互至关重要,但由于两大主要障碍——数据稀缺与不平衡,仍是一个具有挑战性的问题。许多 SER 数据集存在显著不平衡,其中某一类(最常见为中性)的话语数据远多于其他类。此外,对于许多现有口语语言,可用的数据资源十分有限。为解决这些问题,我们利用由三元组网络引导的基于 GAN 的增强模型,以在训练数据不平衡且不足的情况下提升 SER 性能。我们开展实验并表明:1)在高度不平衡的数据集上,我们的增强策略显著提升了 SER 性能(相较基线召回分数提高 8%)。2)此外,在一个跨语言基准中,我们使用充足的源语言话语但极少的目标语言话语(实验中约 50 条)训练模型,我们的增强策略为三种目标语言的 SER 性能均带来了增益。

关键词

引用

@article{arxiv.2208.04994,
  title  = {Generative Data Augmentation Guided by Triplet Loss for Speech Emotion Recognition},
  author = {Shijun Wang and Hamed Hemati and Jón Guðnason and Damian Borth},
  journal= {arXiv preprint arXiv:2208.04994},
  year   = {2022}
}

备注

Published in INTERSPEECH 2022