联合学习语音情感与自动语音识别的有效性及噪声鲁棒性研究
音频与语音处理
2023-05-29 v2 人工智能
声音
摘要
新一代对话智能体系统在噪声环境的真实应用中,通常采用两种独立且常相互分离的方法分别完成语音情感识别(SER)与自动语音识别(ASR)。本文研究低资源设定下的联合ASR-SER多任务学习方法,表明不仅在SER上,在ASR上也观察到性能提升。我们还考察了此类联合训练模型对背景噪声、嘈杂人声和音乐的鲁棒性。在IEMOCAP数据集上的实验结果显示,联合学习在干净场景下可将ASR词错率(WER)和SER分类准确率分别提升10.7%和2.3%。在噪声场景下,基于MUSAN增广数据的结果表明,联合方法在许多噪声条件下均优于独立的ASR与SER方法。总体而言,联合ASR-SER方法比独立的ASR与SER方法产生了更具抗噪性的模型。
引用
@article{arxiv.2305.12540,
title = {On the Efficacy and Noise-Robustness of Jointly Learned Speech Emotion and Automatic Speech Recognition},
author = {Lokesh Bansal and S. Pavankumar Dubagunta and Malolan Chetlur and Pushpak Jagtap and Aravind Ganapathiraju},
journal= {arXiv preprint arXiv:2305.12540},
year = {2023}
}
备注
accepted to be part of INTERSPEECH 2023