用于域自适应说话人识别的连体x-vector重构
音频与语音处理
2020-07-29 v1 机器学习
声音
摘要
随着声控应用的兴起,对说话人识别的需求迅速增长。x-vector作为一种基于深度神经网络(DNN)的嵌入方法,在无法进行恰当端到端训练时被视为最先进的方法。然而,当录音条件(噪声、采样率等)不匹配时——无论是在x-vector训练数据与目标数据之间,还是在注册与测试数据之间——其准确率都会显著下降。我们引入了用于域自适应的连体x-vector重构(SVR)。我们利用一个轻量辅助连体DNN,从质量较低的对应信号重构出高质量信号的嵌入。我们在多种不匹配场景下评估了该方法,并展示了相对于基线的显著改进。
引用
@article{arxiv.2007.14146,
title = {Siamese x-vector reconstruction for domain adapted speaker recognition},
author = {Shai Rozenberg and Hagai Aronowitz and Ron Hoory},
journal= {arXiv preprint arXiv:2007.14146},
year = {2020}
}