中文

中性及呼喊说话环境下的阿联酋口音说话人识别

声音 2018-04-04 v1 音频与语音处理

摘要

本工作致力于分别在中性和呼喊说话环境下采集阿联酋口音语音数据库(阿拉伯联合酋长国数据库),以便基于一阶循环超段隐马尔可夫模型(CSPHMM1s)、二阶循环超段隐马尔可夫模型(CSPHMM2s)和三阶循环超段隐马尔可夫模型(CSPHMM3s)作为分类器,研究和提升与文本无关的阿联酋口音说话人在呼喊环境下的识别性能。在本研究中,我们的数据库收集自五十名阿联酋母语说话人(每性别二十五人),分别在中性和呼喊说话环境下说出八个常见的阿联酋语句。我们采集数据库所提取的特征称为 Mel 频率倒谱系数(MFCCs)。我们的结果表明,基于 CSPHMM1s、CSPHMM2s 和 CSPHMM3s,中性环境下的平均阿联酋口音说话人识别性能分别为 94.0%、95.2% 和 95.9%。另一方面,基于 CSPHMM1s、CSPHMM2s 和 CSPHMM3s,呼喊环境下的平均性能分别为 51.3%、55.5% 和 59.3%。基于 CSPHMM3s 在呼喊环境下获得的平均说话人识别性能,与人类听众主观评估获得的结果非常相似。

关键词

引用

@article{arxiv.1804.00981,
  title  = {Emirati-Accented Speaker Identification in each of Neutral and Shouted Talking Environments},
  author = {Ismail Shahin and Ali Bou Nassif and Mohammed Bahutair},
  journal= {arXiv preprint arXiv:1804.00981},
  year   = {2018}
}

备注

14 pages, 3 figures. arXiv admin note: text overlap with arXiv:1707.00686