面向说话人无关跨语言跨语料语音情感识别的端到端迁移学习
音频与语音处理
2025-12-15 v3
摘要
数据驱动模型在语音情感识别(SER)中取得了成功结果。然而,这些通常基于通用声学特征或端到端方法的模型,在测试集与训练集语言不同或这些集合取自不同数据集时表现不佳。为缓解这些问题,本文提出一种基于迁移学习的端到端深度神经网络(DNN)模型,用于跨语言与跨语料 SER。我们使用 wav2vec 2.0 预训练模型将来自不同语言、不同说话人与不同录音条件的音频时域波形转换到多语言共享的特征空间,从而降低语音嵌入中的语言差异。接下来,我们提出一种新的类内深度协方差归一化(Deep-WCCN)层,可插入 DNN 模型中,旨在降低包括说话人差异、信道差异等在内的其他差异。整个模型在联合损失下以端到端方式微调,并在三种语言(即英语、德语、汉语)的数据集上验证。实验结果表明,我们所提方法在同源语言与跨语言设定下均优于基于通用声学特征集的基线 SER 模型。此外,我们还通过实验验证了 Deep-WCCN 的有效性,其可进一步提升模型性能。接着,我们表明所提迁移学习方法在将目标语言数据并入微调过程时具有良好的数据效率:仅使用 160 秒目标语言数据时,模型的说话人无关 SER 性能提升高达 15.6%。最后,我们提出的模型在跨语言 SER 中显著优于其他最先进模型。
引用
@article{arxiv.2311.13678,
title = {End-to-end transfer learning for speaker-independent cross-language and cross-corpus speech emotion recognition},
author = {Duowei Tang and Peter Kuppens and Lucca Geurts and Toon van Waterschoot},
journal= {arXiv preprint arXiv:2311.13678},
year = {2025}
}
备注
27 pages, 6 figures, 4 tables