用于语音情感识别的多窗口数据增强方法
声音
2022-02-17 v4 人工智能
机器学习
音频与语音处理
摘要
我们提出一种用于语音情感识别的多窗口数据增强(MWA-SER)方法。MWA-SER 是一种单模态方法,聚焦于两个关键概念:设计语音增强方法,以及构建深度学习模型以识别音频信号的内在情感。我们提出的多窗口增强方法通过在音频特征提取过程中采用多种窗口大小,从语音信号生成额外的数据样本。我们展示了我们的增强方法结合深度学习模型可改善语音情感识别性能。我们在三个基准数据集 IEMOCAP、SAVEE 和 RAVDESS 上评估了我们方法的性能。我们表明多窗口模型提升了 SER 性能并优于单窗口模型。寻找最佳窗口大小是音频特征提取中的重要步骤。我们进行了广泛的实验评估以寻找最佳窗口选择,并探索了窗口化对 SER 分析的影响。
引用
@article{arxiv.2010.09895,
title = {Multi-Window Data Augmentation Approach for Speech Emotion Recognition},
author = {Sarala Padi and Dinesh Manocha and Ram D. Sriram},
journal= {arXiv preprint arXiv:2010.09895},
year = {2022}
}