中文

用于带情感语音说话人识别的情感不变说话人嵌入

音频与语音处理 2020-10-09 v1 声音

摘要

说话人的情感状态被发现对语音产生有显著影响,这会使语音偏离中性状态下的语音。这使得识别具有不同情感的说话人成为一项具有挑战性的任务,因为通常说话人模型是使用中性语音训练的。在本工作中,我们提出通过创建情感不变说话人嵌入来克服这一问题。我们学习一个提取器网络,将使用基于 i-vector 的系统获得的具有不同情感的测试嵌入映射到情感不变空间。由此产生的测试嵌入因此变得情感不变,从而补偿各种情感状态之间的失配。研究使用来自 IEMOCAP 数据库的四种不同情感类别进行。在使用情感不变说话人嵌入的说话人识别研究中,相较于基于不同情感的平均说话人模型框架,我们获得了 2.6% 的绝对准确率提升。

关键词

引用

@article{arxiv.2010.03909,
  title  = {Emotion Invariant Speaker Embeddings for Speaker Identification with Emotional Speech},
  author = {Biswajit Dev Sarma and Rohan Kumar Das},
  journal= {arXiv preprint arXiv:2010.03909},
  year   = {2020}
}

备注

Accepted for publication in APSIPA ASC 2020