用于噪声环境下鲁棒说话人识别的样内变异不变损失
音频与语音处理
2020-02-14 v2 声音
摘要
尽管深度神经网络显著改进了说话人识别,但在噪声环境下性能仍不尽如人意。本文中,我们训练说话人嵌入网络以学习噪声语句的“干净”嵌入。具体而言,该网络以原始说话人识别损失辅以样内变异不变损失进行训练。该辅助变异不变损失用于学习干净语句与其噪声副本之间的相同嵌入,并防止网络将不期望的噪声或变异编码进说话人表示。此外,我们研究了在训练时动态生成干净与噪声语句对的数据准备策略。该策略在每个训练步为同一干净语句生成不同的噪声副本,帮助说话人嵌入网络在噪声环境下更好地泛化。在 VoxCeleb1 上的实验表明,所提训练框架在干净与噪声条件下均提升了说话人验证系统的性能。
引用
@article{arxiv.2002.00924,
title = {Within-sample variability-invariant loss for robust speaker recognition under noisy environments},
author = {Danwei Cai and Weicheng Cai and Ming Li},
journal= {arXiv preprint arXiv:2002.00924},
year = {2020}
}
备注
Accepted at ICASSP 2020