中文

基于小波的Mel频率倒谱系数在隐马尔可夫模型说话人识别中的应用

声音 2010-03-31 v1 机器学习

摘要

为了提高说话人识别系统的性能,提出了一种有效且鲁棒的语音特征提取方法,能够在噪声环境下运行。基于小波变换的时频多分辨率特性,将输入语音信号分解为多个频率通道。为了捕获信号的特征,计算了小波通道的Mel频率倒谱系数(MFCCs)。隐马尔可夫模型(HMMs)被用于识别阶段,因为它们比动态时间规整(DTW)能更好地识别说话人特征。将所提出的方法与MFCCs传统特征提取方法进行比较,结果表明所提出的方法不仅有效降低了噪声的影响,而且提高了识别率。使用所提出的特征提取技术获得了99.3%的识别率,而使用MFCCs为98.7%。当测试模式被信噪比为20 dB的加性高斯白噪声破坏时,使用所提出方法的识别率为97.3%,而使用MFCCs为93.3%。

关键词

引用

@article{arxiv.1003.5627,
  title  = {Wavelet-Based Mel-Frequency Cepstral Coefficients for Speaker Identification using Hidden Markov Models},
  author = {Mahmoud I. Abdalla and Hanaa S. Ali},
  journal= {arXiv preprint arXiv:1003.5627},
  year   = {2010}
}