面向多领域说话人识别的对抗训练
声音
2020-11-18 v1 音频与语音处理
摘要
在实际应用场景中,当训练与评估数据之间存在不匹配时,说话人识别系统的性能总会下降。许多领域自适应方法已成功用于消除说话人识别中的领域失配。然而,通常训练与评估数据本身可由若干子集构成。各数据集的内部差异也可被视为不同领域。源或目标领域数据集中不同分布的子集也会引发多领域失配,这对说话人识别性能有影响。在本研究中,我们提出使用对抗训练解决说话人识别中的领域失配与数据集方差问题。通过采用所提方法,我们能够获得既多领域不变又具说话人判别性的语音表征用于说话人识别。在 DAC13 数据集上的实验结果表明,该方法不仅能有效解决多领域失配问题,而且优于所对比的无监督领域自适应方法。
引用
@article{arxiv.2011.08623,
title = {Adversarial Training for Multi-domain Speaker Recognition},
author = {Qing Wang and Wei Rao and Pengcheng Guo and Lei Xie},
journal= {arXiv preprint arXiv:2011.08623},
year = {2020}
}
备注
5 pages, 2 figures