通过微调Transformer进行波斯语语音情感识别
人工智能
2024-02-14 v1 声音
音频与语音处理
摘要
鉴于语音情感识别的重要性,近年来已开发出许多方法来创建该领域有效且高效的系统。其中一种方法涉及使用预训练的Transformer,并针对这一特定问题进行微调,从而获得高精度。尽管在全球范围内进行了广泛的讨论和努力来增强这些系统,但这种创新且有效的方法在波斯语语音情感识别背景下的应用却较少受到关注。在本文中,我们回顾了语音情感识别领域及其背景,并强调了在此背景下使用Transformer的重要性。我们提出了两个模型,一个基于频谱图,另一个基于音频本身,并使用shEMO数据集进行了微调。这些模型显著提高了先前系统的准确率,在所述数据集上从约65%提高到80%。随后,为了研究多语言性对微调过程的影响,这些相同的模型被微调了两次。首先,使用英语IEMOCAP数据集进行微调,然后使用波斯语shEMO数据集进行微调。这使得波斯语情感识别系统的准确率提高到了82%。
引用
@article{arxiv.2402.07326,
title = {Persian Speech Emotion Recognition by Fine-Tuning Transformers},
author = {Minoo Shayaninasab and Bagher Babaali},
journal= {arXiv preprint arXiv:2402.07326},
year = {2024}
}