噪声环境下阿拉伯语说话人识别中声学特征的研究
音频与语音处理
2021-10-26 v1 声音
摘要
语音识别领域的主要部分之一是声学特征的选择,这些特征必须对抗语音信号的可变性、不匹配条件以及噪声环境具有鲁棒性。因此,不同的语音特征提取技术已被开发出来。在本文中,我们研究了若干前端技术在阿拉伯语说话人识别中的鲁棒性。我们在嘈杂人声、工厂和地铁条件下,于不同信噪比(SNR)评估了五种不同特征。所得结果表明,两种听觉特征即伽马通频率倒谱系数(GFCC)和功率归一化倒谱系数(PNCC),不同于它们的组合,表现明显优于常规的说话人特征即梅尔频率倒谱系数(MFCC)。
引用
@article{arxiv.2110.12304,
title = {A Study of Acoustic Features in Arabic Speaker Identification under Noisy Environmental Conditions},
author = {Zhor Benhafid and Kawthar Yasmine Zergat and Abderrahmane Amrouche},
journal= {arXiv preprint arXiv:2110.12304},
year = {2021}
}