中文

噪声环境下 x-vector 说话人识别系统的数据增强与噪声补偿对比

声音 2020-06-30 v1 计算与语言 音频与语音处理

摘要

可用语音数据的激增以及基于深度神经网络(DNN)的新说话人建模方法,使得开发更鲁棒的说话人识别系统成为可能。在 DNN 说话人建模技术中,x-vector 系统在噪声环境下已展现出一定程度的鲁棒性。先前研究表明,通过增加训练数据中的说话人数量并使用数据增强,可在噪声环境下获得更鲁棒的说话人识别系统。本工作中,我们欲探明尽管此类系统具有普遍的噪声鲁棒性,显式噪声补偿技术是否依然有效。为此,我们将使用两个不同的 x-vector 网络:第一个在 Voxceleb1 上训练(协议1),第二个在 Voxceleb1+Voxveleb2 上训练(协议2)。我们提出在打分前加入一个去噪 x-vector 子系统。实验结果表明,协议2所用的 x-vector 系统比协议1所用的另一系统更鲁棒。尽管有此观察,我们将展示显式噪声补偿在两种协议下均带来几乎相同的 EER 相对增益。例如,在协议2中,使用去噪技术使 EER 改善了 21% 至 66%。

关键词

引用

@article{arxiv.2006.15903,
  title  = {Data augmentation versus noise compensation for x- vector speaker recognition systems in noisy environments},
  author = {Mohammad Mohammadamini and Driss Matrouf},
  journal= {arXiv preprint arXiv:2006.15903},
  year   = {2020}
}