在人声噪声条件下使用目标说话人提取的鲁棒语音情感识别两阶段框架
声音
2024-12-18 v2 计算与语言
音频与语音处理
摘要
在噪声条件下开发鲁棒的语音情感识别(SER)系统面临着由不同噪声特性带来的挑战。以往的大多数研究并未考虑人声噪声的影响,从而限制了SER的应用范围。在本文中,我们针对该问题提出了一种新颖的两阶段框架,该框架级联了目标说话人提取(TSE)方法和SER。我们首先训练一个TSE模型,从混合语音中提取目标说话人的语音。然后,在第二阶段,我们利用提取出的语音进行SER训练。此外,我们还探索了在第二阶段对TSE和SER模型进行联合训练。我们开发的系统在未加权准确率(UA)上相比未使用TSE方法的基线系统提高了14.33%,证明了我们的框架在减轻人声噪声影响方面的有效性。此外,我们还进行了考虑说话人性别的实验,结果表明我们的框架在不同性别的混合语音中表现尤为出色。
引用
@article{arxiv.2409.19585,
title = {Two-stage Framework for Robust Speech Emotion Recognition Using Target Speaker Extraction in Human Speech Noise Conditions},
author = {Jinyi Mi and Xiaohan Shi and Ding Ma and Jiajun He and Takuya Fujimura and Tomoki Toda},
journal= {arXiv preprint arXiv:2409.19585},
year = {2024}
}
备注
This is the preprint version of the paper accepted at APSIPA ASC 2024