中文

基于 Cycle-GAN 的低资源域自适应说话人识别

音频与语音处理 2019-10-29 v1 声音

摘要

当前的说话人识别技术在 x-vector 方法下表现优异。然而,当评估域与训练域不同时性能会下降,该问题通常通过域自适应方法解决。近来,使用循环一致生成对抗网络(CycleGAN)的无监督域自适应受到广泛关注。CycleGAN 可在给定非平行数据的情况下学习两个域特征间的映射。我们研究了它们在低资源场景下的有效性,即仅有少量目标域数据可用于自适应时——这是以往工作未探索过的情况。我们实验了两项自适应任务:麦克风到电话,以及一种新颖的混响到干净自适应,最终目标是提升说话人识别性能。源域和目标域中说话人数量分别为 7000 和 191。通过在 CycleGAN 训练期间向目标域加噪,我们相比在更大数据上训练 CycleGAN 的自适应系统取得了更优性能。在混响到干净自适应任务上,我们的模型在 VOiCES 数据集上相较干净数据训练的系统相对改善了 18.3% 的等错误率(EER)。它们也略优于最先进的加权预测误差(WPE)去混响算法。

关键词

引用

@article{arxiv.1910.11909,
  title  = {Low-Resource Domain Adaptation for Speaker Recognition Using Cycle-GANs},
  author = {Phani Sankar Nidadavolu and Saurabh Kataria and Jesús Villalba and Najim Dehak},
  journal= {arXiv preprint arXiv:1910.11909},
  year   = {2019}
}

备注

8 pages, accepted to ASRU 2019