中文

基于CSPHMM2s的应激与情感说话环境下的说话条件识别

声音 2017-07-03 v1

摘要

本研究旨在利用二阶循环超音段隐马尔可夫模型(CSPHMM2s)作为分类器,以提升在应激和情感说话环境(完全两个不同的环境)中的说话条件识别。本工作使用的应激说话环境采用Speech Under Simulated and Actual Stress (SUSAS)数据库,而情感说话环境使用Emotional Prosody Speech and Transcripts (EPST)数据库。使用梅尔频率倒谱系数(MFCCs)所取得的成果表明,在提升应激和情感说话环境中的说话条件识别方面,CSPHMM2s优于隐马尔可夫模型(HMMs)、二阶循环隐马尔可夫模型(CHMM2s)和超音段隐马尔可夫模型(SPHMMs)中的每一种。结果还显示,基于CSPHMM2s的应激说话环境下的说话条件识别性能领先情感说话环境3.67%。我们通过人类评委主观评价获得的结果,分别落在基于CSPHMM2s在应激和情感说话环境下所得结果的2.14%和3.08%范围内。

关键词

引用

@article{arxiv.1706.09729,
  title  = {Talking Condition Recognition in Stressful and Emotional Talking Environments Based on CSPHMM2s},
  author = {Ismail Shahin and Mohammed Nasser Ba-Hutair},
  journal= {arXiv preprint arXiv:1706.09729},
  year   = {2017}
}