训练多任务对抗网络以提取噪声鲁棒说话人嵌入
声音
2019-05-14 v2 音频与语音处理
摘要
在噪声环境下,实现说话人识别的鲁棒性能仍是一项具有挑战性的任务。受多任务训练在多种图像处理任务中表现优异的启发,我们探索了多任务对抗训练在学习噪声鲁棒说话人嵌入方面的潜力。本文提出了一种由三部分组成的新框架:提取噪声鲁棒说话人嵌入的编码器;对说话人进行分类的分类器;判别说话人嵌入噪声类型的判别器。此外,我们提出了一种以训练准确率作为指标来稳定多类对抗优化过程的训练策略。我们在英文和普通话语料库上进行实验,实验结果表明,我们提出的多任务对抗训练方法在噪声环境下大幅优于其他无对抗训练的方法。进一步实验表明,我们的方法也能提升干净条件下的说话人验证性能。
引用
@article{arxiv.1811.09355,
title = {Training Multi-Task Adversarial Network for Extracting Noise-Robust Speaker Embedding},
author = {Jianfeng Zhou and Tao Jiang and Lin Li and Qingyang Hong and Zhe Wang and Bingyin Xia},
journal= {arXiv preprint arXiv:1811.09355},
year = {2019}
}
备注
accepted by ICASSP2019