对抗说话人验证
声音
2019-04-30 v1 计算与语言
机器学习
音频与语音处理
机器学习
摘要
使用深度网络提取用于说话人识别的嵌入已证明成功。然而,由于训练、注册和测试条件之间的不匹配,此类嵌入易出现性能退化。在本工作中,我们提出一种对抗说话人验证(ASV)方案,通过对抗多任务训练来学习条件不变的深度嵌入。在 ASV 中,一个说话人分类网络和一个条件识别网络被联合优化以最小化说话人分类损失,同时极小极大化条件损失。条件网络的目标标签可以是类别型(环境类型)和连续型(SNR 值)。我们进一步提出多因子 ASV 以同时抑制构成条件可变性的多个因素。在 Microsoft Cortana 文本相关说话人验证任务上评估,ASV 在已知和未知条件下分别实现了 8.8% 和 14.5% 的等错误率(EER)相对提升。
引用
@article{arxiv.1904.12406,
title = {Adversarial Speaker Verification},
author = {Zhong Meng and Yong Zhao and Jinyu Li and Yifan Gong},
journal= {arXiv preprint arXiv:1904.12406},
year = {2019}
}
备注
5 pages, 1 figure, ICASSP 2019