中文

Neural i-vectors

音频与语音处理 2020-04-21 v2 机器学习

摘要

在近期的说话人验证评测中,深度说话人嵌入已被证明优于其生成式对应物 i-vectors。为了结合高性能与生成式解释的优势,我们研究了连续使用深度嵌入提取器和 i-vector 提取器的方法。为了将深度嵌入提取器与 i-vector 提取器捆绑,我们在嵌入提取器网络中采用了受高斯混合模型(GMM)启发的聚合层。引入类 GMM 层使得判别式训练的网络能够作为充分统计量的提供者,供 i-vector 提取器提取我们称之为 neural i-vectors 的特征。我们在 Speakers in the Wild (SITW) 以及 Speaker Recognition Evaluation (SRE) 2018 和 2019 数据集上,将深度嵌入与所提出的 neural i-vectors 进行了比较。在 SITW 的 core-core 条件上,我们的深度嵌入获得了与 SOTA 相当的性能。Neural i-vectors 的性能比深度嵌入差约 50%,但另一方面,它们以明显的优势优于文献中报道的以往 i-vector 方法。

关键词

引用

@article{arxiv.2004.01559,
  title  = {Neural i-vectors},
  author = {Ville Vestman and Kong Aik Lee and Tomi H. Kinnunen},
  journal= {arXiv preprint arXiv:2004.01559},
  year   = {2020}
}

备注

Accepted to Odyssey 2020: The Speaker and Language Recognition Workshop. Version 2 (bugfix)