中文

用于鲁棒说话人验证的解耦说话人与 nuisance 属性嵌入

音频与语音处理 2020-08-10 v1 声音

摘要

近年来,各种基于深度学习的嵌入方法被提出,并在说话人验证中展现出令人印象深刻的性能。然而,正如大多数经典嵌入技术一样,已知基于深度学习的方法在处理具有不同条件(如录音设备、情绪状态)的语音样本时会遭受严重的性能下降。本文中,我们提出一种新颖的全监督训练方法,用于提取与由nuisance属性引起的变异性解耦的说话人嵌入向量。所提出的框架使用RSR2015和VoxCeleb1数据集与传统的基于深度学习的嵌入方法进行了比较。实验结果表明,所提出的方法能够提取对信道和情绪变异性鲁棒的说话人嵌入。

关键词

引用

@article{arxiv.2008.03024,
  title  = {Disentangled speaker and nuisance attribute embedding for robust speaker verification},
  author = {Woo Hyun Kang and Sung Hwan Mun and Min Hyun Han and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2008.03024},
  year   = {2020}
}

备注

Accepted in IEEE Access