增强语音情感识别对噪声、对抗攻击与跨语料库设置鲁棒性的深度架构
声音
2020-07-28 v3 音频与语音处理
摘要
当训练与测试数据同分布时,语音情感识别系统(SER)可达到高准确率,但这一假设在实践中常被违背,且SER系统在面对未预见的数据偏移时性能急剧下降。设计用于准确SER的鲁棒模型具有挑战性,这限制了其在实际应用中的使用。本文提出一种更深的神经网络架构,其中融合DenseNet、LSTM与Highway Network以学习对噪声鲁棒的强判别特征。我们还提出结合本网络架构的数据增强以进一步提升鲁棒性。我们全面评估了该架构结合数据增强在以下方面的表现:(1)噪声,(2)对抗攻击,(3)跨语料库设置。在广泛使用的IEMOCAP与MSP-IMPROV数据集上的评估显示,与现有研究及最先进(state-of-the-art)模型相比,取得了有前景的结果。
引用
@article{arxiv.2005.08453,
title = {Deep Architecture Enhancing Robustness to Noise, Adversarial Attacks, and Cross-corpus Setting for Speech Emotion Recognition},
author = {Siddique Latif and Rajib Rana and Sara Khalifa and Raja Jurdak and Björn W. Schuller},
journal= {arXiv preprint arXiv:2005.08453},
year = {2020}
}
备注
Accepted in INTERSPEECH 2020