基于 Cycle-GAN 的低资源域自适应说话人识别
音频与语音处理
2019-10-29 v1 声音
摘要
当前的说话人识别技术在 x-vector 方法下表现优异。然而,当评估域与训练域不同时性能会下降,该问题通常通过域自适应方法解决。近来,使用循环一致生成对抗网络(CycleGAN)的无监督域自适应受到广泛关注。CycleGAN 可在给定非平行数据的情况下学习两个域特征间的映射。我们研究了它们在低资源场景下的有效性,即仅有少量目标域数据可用于自适应时——这是以往工作未探索过的情况。我们实验了两项自适应任务:麦克风到电话,以及一种新颖的混响到干净自适应,最终目标是提升说话人识别性能。源域和目标域中说话人数量分别为 7000 和 191。通过在 CycleGAN 训练期间向目标域加噪,我们相比在更大数据上训练 CycleGAN 的自适应系统取得了更优性能。在混响到干净自适应任务上,我们的模型在 VOiCES 数据集上相较干净数据训练的系统相对改善了 18.3% 的等错误率(EER)。它们也略优于最先进的加权预测误差(WPE)去混响算法。
引用
@article{arxiv.1910.11909,
title = {Low-Resource Domain Adaptation for Speaker Recognition Using Cycle-GANs},
author = {Phani Sankar Nidadavolu and Saurabh Kataria and Jesús Villalba and Najim Dehak},
journal= {arXiv preprint arXiv:1910.11909},
year = {2019}
}
备注
8 pages, accepted to ASRU 2019