中文

基于 MFCC 与 ANN 在 PCVC 语音数据集上的波斯语元音识别

声音 2018-12-18 v1 计算与语言 机器学习 音频与语音处理

摘要

本文提出了一种在新波斯语语音数据集 PCVC(Persian Consonant-Vowel Combination,波斯语辅音-元音组合)上识别辅音-元音音素组合的新方法,该数据集用于识别波斯语音素。在 PCVC 数据集中,有来自 10 位说话人的 20 组音频样本,为波斯语 23 个辅音和 6 个元音音素的组合。每个样本中包含一个元音和一个辅音的组合。首先发出辅音音素,随后紧接发出元音音素。每个声音样本为一帧 2 秒的音频。在每 2 秒内,平均有 0.5 秒的语音,其余为静音。本文提出的方法是对每个分割后的声音样本实施 MFCC(Mel Frequency Cepstrum Coefficients,梅尔频率倒谱系数)提取。然后,将每个 MFCC 向量的训练样本送入多层感知机前馈 ANN(Artificial Neural Network,人工神经网络)进行训练。最后,在 ANN 模型上对测试样本进行音素识别检验。经过训练和测试过程后,给出了元音识别的结果。随后,计算了元音音素识别的平均百分比。

关键词

引用

@article{arxiv.1812.06953,
  title  = {Persian Vowel recognition with MFCC and ANN on PCVC speech dataset},
  author = {Saber Malekzadeh and Mohammad Hossein Gholizadeh and Seyed Naser Razavi},
  journal= {arXiv preprint arXiv:1812.06953},
  year   = {2018}
}

备注

The 5th International Conference of Electrical Engineering, Computer Science and Information Technology 2018