中文

利用语音中的压力信息进行说话人识别的研究

声音 2014-10-28 v1

摘要

当说话人处于压力或情绪状态下时,说话人识别系统的性能会下降。本文探索并确定了一种机制,能够利用个人语音中固有的语音压力或说话风格信息作为说话人识别的附加线索。我们主要使用三个特征,即音高、振幅和时长(统称为 PAD),来量化说话人语音中固有的压力。实验观察到,同一说话人在不同单词中相似音素的 PAD 向量在三维 (PAD) 空间中彼此接近,这证实了说话人对其语音中不同音节的加压方式是其独有的。因此,我们提出将基于 PAD 的说话人说话风格作为说话人识别应用的附加特征。

关键词

引用

@article{arxiv.1410.6905,
  title  = {On the use of Stress information in Speech for Speaker Recognition},
  author = {Laxmi Narayana M. and Sunil Kumar Kopparapu},
  journal= {arXiv preprint arXiv:1410.6905},
  year   = {2014}
}