用于跨语料库与跨语言语音情感识别的自监督对抗域适应
声音
2022-04-20 v1 音频与语音处理
摘要
尽管语音情感识别(SER)在单一语料库设定下近期取得进展,这些SER系统在跨语料库与跨语言场景中的性能显著下降。关键原因在于SER系统对未见条件的泛化不足,导致其在跨语料库与跨语言设定下表现糟糕。近期研究聚焦于利用对抗方法学习域泛化表示以改善跨语料库与跨语言SER来解决此问题。然而,许多方法仅关注跨语料库SER,未解决因源语言与目标语言数据间更大域差距导致的跨语言SER性能下降。本工作提出对抗双判别器(ADDi)网络,使用三方对抗博弈学习泛化表示而无需任何目标数据标签。我们还引入自监督ADDi(sADDi)网络,利用无标签数据的自监督预训练。我们在sADDi中提出以合成数据生成作为前置任务,使网络产生具情感判别性与域不变性的表示,并提供互补合成数据以增强系统。所提模型使用三种语言的五个公开数据集严格评估,并与多项跨语料库与跨语言SER研究比较。实验结果表明,所提模型相较SOTA方法取得更优性能。
引用
@article{arxiv.2204.08625,
title = {Self Supervised Adversarial Domain Adaptation for Cross-Corpus and Cross-Language Speech Emotion Recognition},
author = {Siddique Latif and Rajib Rana and Sara Khalifa and Raja Jurdak and Björn Schuller},
journal= {arXiv preprint arXiv:2204.08625},
year = {2022}
}
备注
Accepted in IEEE Transactions on Affective Computing