基于 CASA 与级联 GMM-CNN 分类器的噪声及情绪语音条件下说话人识别
声音
2021-02-12 v1 人工智能
音频与语音处理
摘要
本工作旨在增强文本无关说话人识别在噪声和情绪语音等实际应用情境下的性能。这是通过结合两个不同模块实现的:用于降噪的基于计算听觉场景分析(CASA)的预处理模块,以及用于说话人识别并随后进行情绪识别的级联高斯混合模型-卷积神经网络(GMM-CNN)分类器。本研究提出并评估了一种新算法,以提升在情绪化且高度易噪条件下的说话人识别准确率。实验表明,当在噪声环境中使用语音在模拟与实际压力下的数据库(SUSAS)、阿联酋语音数据库(ESD)、Ryerson 情感语音与歌曲视听数据库(RAVDESS)以及 Fluent Speech Commands 数据库时,所提模型相较于其他分类器取得了有前景的结果。
引用
@article{arxiv.2102.05894,
title = {CASA-Based Speaker Identification Using Cascaded GMM-CNN Classifier in Noisy and Emotional Talking Conditions},
author = {Ali Bou Nassif and Ismail Shahin and Shibani Hamsa and Nawel Nemmour and Keikichi Hirose},
journal= {arXiv preprint arXiv:2102.05894},
year = {2021}
}
备注
Published in Applied Soft Computing journal