中文

一种用于鲁棒 i-vector 说话人识别的改进的不确定性传播方法

声音 2019-02-20 v2 人工智能 音频与语音处理

摘要

当面对包含加性噪声和/或混响的失真语音数据时,自动说话人识别系统的性能会下降。统计不确定性传播已被引入作为一种应对该挑战的有前景的范式。迄今为止,在说话人识别背景下,已提出了多种不确定性传播方法来补偿 i-vector 中的噪声和混响。它们在 YOHO 和 Wall Street Journal 等小型数据集上取得了有前景的结果,但在更大、高度可变的 NIST Speaker Recognition Evaluation (SRE) 语料库上却几乎没有改进。在本文中,我们提出了一种完整的不确定性传播方法,在无偏 Baum-Welch 统计量的计算和 i-vector 后验期望的推导中,我们都对不确定性的影响进行了建模。我们在混有来自 CHiME-2 语料库的真实家庭噪声和混响,并经过多通道语音增强预处理的 NIST-SRE 语料库上进行了实验。与传统的基于 i-vector 的说话人确认基线相比,所提出的方法将等错误率 (EER) 相对降低了 4%。相比之下,以往的方法反而会导致性能下降。

关键词

引用

@article{arxiv.1902.05761,
  title  = {An improved uncertainty propagation method for robust i-vector based speaker recognition},
  author = {Dayana Ribas and Emmanuel Vincent},
  journal= {arXiv preprint arXiv:1902.05761},
  year   = {2019}
}