利用习得语音分离与Speech VGG从情感与含噪语音数据中识别说话人
音频与语音处理
2022-10-25 v1 声音
摘要
与其他信号相比,语音信号受到更多的声学干扰与情感因素影响。充满噪声与情感的语音数据对实时语音处理应用而言是一项挑战。寻找一种有效方法将主导信号从其他外部影响中分离出来至关重要。一个理想的系统应能在不利情形下从复杂场景准确识别所需的听觉事件。本文提出一种在情感与干扰等不利条件下利用预训练深度神经网络掩码与Speech VGG进行说话人识别的新方法。所提模型在英语与阿拉伯语情感语音数据上优于近期文献,并分别在Ryerson音视频数据集(RAVDESS)、模拟与实际压力下的语音(SUSAS)数据集以及阿联酋口音语音数据集(ESD)上取得了85.2%、87.0%与86.6%的平均说话人识别率。
引用
@article{arxiv.2210.12701,
title = {Speaker Identification from emotional and noisy speech data using learned voice segregation and Speech VGG},
author = {Shibani Hamsa and Ismail Shahin and Youssef Iraqi and Ernesto Damiani and Naoufel Werghi},
journal= {arXiv preprint arXiv:2210.12701},
year = {2022}
}
备注
Journal