中文

CopyPaste:一种用于语音情感识别的数据增强方法

声音 2021-02-12 v2 机器学习 音频与语音处理

摘要

数据增强是训练鲁棒机器学习模型的广泛使用策略。它部分缓解了语音情感识别(SER)等任务中数据有限的问题,在这些任务中,收集数据既昂贵又具有挑战性。本研究提出了 CopyPaste,一种受感知启发的、用于 SER 的新型增强过程。假设录音中非中性情感的存在决定了说话者的整体感知情感,将情感(情感 E)和中性话语拼接后仍可标记为情感 E。我们假设在模型训练中使用这些拼接后的话语可以改善 SER 性能。为了验证这一点,在两个深度学习模型上测试了三种 CopyPaste 方案:一个独立训练的模型,另一个使用 x-vector 模型(一种说话人识别模型)进行迁移学习的模型。我们观察到,在所考虑的三个数据集 MSP-Podcast、Crema-D 和 IEMOCAP 上,所有三种 CopyPaste 方案均改善了 SER 性能。此外,CopyPaste 的性能优于噪声增强,且将两者结合使用可进一步提升 SER 性能。我们在含噪测试集上的实验表明,CopyPaste 即使在含噪测试条件下也是有效的。

关键词

引用

@article{arxiv.2010.14602,
  title  = {CopyPaste: An Augmentation Method for Speech Emotion Recognition},
  author = {Raghavendra Pappagari and Jesús Villalba and Piotr Żelasko and Laureano Moro-Velazquez and Najim Dehak},
  journal= {arXiv preprint arXiv:2010.14602},
  year   = {2021}
}

备注

Accepted at ICASSP2021