SER Evals:语音情感识别的域内与域外基准测试
计算与语言
2024-08-16 v1 人工智能
摘要
随着强大的自监督学习(SSL)模型的出现,语音情感识别(SER)取得了显著进展。然而,这些模型对不同语言和情感表达的泛化能力仍然是一个挑战。我们提出了一个大规模基准测试,用于评估最先进的SER模型在域内和域外设置下的鲁棒性和适应性。我们的基准测试包含一组多样化的多语言数据集,重点关注较少使用的语料库,以评估对新数据的泛化能力。我们采用logit调整来考虑不同的类别分布,并建立一个单一的数据集集群进行系统评估。令人惊讶的是,我们发现主要设计用于自动语音识别的Whisper模型,在跨语言SER中优于专用的SSL模型。我们的结果凸显了对更鲁棒、更具泛化能力的SER模型的需求,而我们的基准测试可作为推动该方向未来研究的宝贵资源。
引用
@article{arxiv.2408.07851,
title = {SER Evals: In-domain and Out-of-domain Benchmarking for Speech Emotion Recognition},
author = {Mohamed Osman and Daniel Z. Kaplan and Tamer Nadeem},
journal= {arXiv preprint arXiv:2408.07851},
year = {2024}
}
备注
Accepted at INTERSPEECH 2024