预训练语音与音频嵌入在语音情感识别中的比较研究
音频与语音处理
2023-04-25 v1 人工智能
机器学习
摘要
预训练模型(PTMs)在语音与音频领域已展现出巨大潜力。从这些模型提取的嵌入作为学习算法的输入,应用于各类下游任务。其中一个关键任务是语音情感识别(SER),其应用广泛,包括客户通话动态分析、心理健康评估和个性化语言学习。PTM 嵌入推动了 SER 的发展,然而,综合考虑嵌入模型架构、预训练所用数据及所遵循预训练流程等多方面的此类 PTM 嵌入的全面比较尚属缺失。对 PTM 嵌入的深入比较将有助于更快速、高效地开发模型,并使其能部署于真实场景。本工作中,我们利用此研究空白,对从八个语音与音频 PTM(wav2vec 2.0、data2vec、wavLM、UniSpeech-SAT、wav2clip、YAMNet、x-vector、ECAPA)提取的嵌入进行比较分析。我们使用四个语音情感数据集(CREMA-D、TESS、SAVEE、Emo-DB),通过在所得嵌入上训练三种算法(XGBoost、Random Forest、FCN)进行广泛实证分析。我们的研究结果表明,在由用于说话人识别的 PTM 所提取嵌入上训练的算法取得最佳性能,其后依次为 wav2clip 和 UniSpeech-SAT。这可说明,说话人识别 PTM 的嵌入之所以性能居首,很可能是因为该模型在说话人识别训练过程中吸收了音调、口音、音高等诸多语音特征信息。本工作的见解将协助未来研究为 SER 相关应用选择嵌入。
引用
@article{arxiv.2304.11472,
title = {A Comparative Study of Pre-trained Speech and Audio Embeddings for Speech Emotion Recognition},
author = {Orchid Chetia Phukan and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2304.11472},
year = {2023}
}