中文

用于域自适应说话人识别的连体x-vector重构

音频与语音处理 2020-07-29 v1 机器学习 声音

摘要

随着声控应用的兴起,对说话人识别的需求迅速增长。x-vector作为一种基于深度神经网络(DNN)的嵌入方法,在无法进行恰当端到端训练时被视为最先进的方法。然而,当录音条件(噪声、采样率等)不匹配时——无论是在x-vector训练数据与目标数据之间,还是在注册与测试数据之间——其准确率都会显著下降。我们引入了用于域自适应的连体x-vector重构(SVR)。我们利用一个轻量辅助连体DNN,从质量较低的对应信号重构出高质量信号的嵌入。我们在多种不匹配场景下评估了该方法,并展示了相对于基线的显著改进。

关键词

引用

@article{arxiv.2007.14146,
  title  = {Siamese x-vector reconstruction for domain adapted speaker recognition},
  author = {Shai Rozenberg and Hagai Aronowitz and Ron Hoory},
  journal= {arXiv preprint arXiv:2007.14146},
  year   = {2020}
}