中文

情感说话环境下的三阶段说话人验证架构

声音 2018-09-07 v1 人工智能 音频与语音处理

摘要

说话人验证在中性说话环境下性能通常较高,而在情感说话环境下则急剧下降。这种情感环境下的性能退化源于在中性环境训练而在情感环境测试之间的不匹配问题。本文提出了一种三阶段说话人验证架构,以提升情感环境下的说话人验证性能。该架构由三个级联阶段组成:性别识别阶段,其后为情感识别阶段,再其后为说话人验证阶段。所提框架在两个不同且独立的情感语音数据集上进行了评估:内部数据集与 Emotional Prosody Speech and Transcripts 数据集。我们的结果表明,基于性别信息与情感信息的说话人验证优于仅基于性别信息、仅基于情感信息以及既无性别信息又无情感信息的说话人验证。基于所提框架获得的平均说话人验证性能与人工听者在主观评估中获得的性能非常接近。

关键词

引用

@article{arxiv.1809.01721,
  title  = {Three-Stage Speaker Verification Architecture in Emotional Talking Environments},
  author = {Ismail Shahin and Ali Bou Nassif},
  journal= {arXiv preprint arXiv:1809.01721},
  year   = {2018}
}

备注

18 pages. arXiv admin note: substantial text overlap with arXiv:1804.00155, arXiv:1707.00137