中文

深度说话人验证:我们需要端到端吗?

声音 2017-06-27 v1 计算与语言

摘要

端到端学习将整个系统视为一个可适应的黑盒,如果有足够的数据,它可以学习到一个对目标任务非常有效的系统。这一原则最近被应用于说话人验证 (SV) 的几项原型研究中,其中特征学习和分类器通过一个与评估指标一致的目标函数一起学习。与端到端相反的方法是特征学习,它首先训练一个特征学习模型,然后单独构建一个后端分类器来执行 SV。最近,这两种方法都在 SV 上取得了显著的性能提升,主要归功于对深度神经网络的巧妙利用。然而,这两种方法尚未得到仔细比较,其各自的优势也未得到充分讨论。在本文中,我们在文本无关的 SV 任务上比较了端到端和特征学习方法。我们在从 Fisher 数据库中采样并包含 5,000 名说话人的数据集上的实验表明,特征学习方法优于端到端方法。这是对特征学习方法的有力支持,至少在数据量和计算资源与本文类似的情况下是如此。

关键词

引用

@article{arxiv.1706.07859,
  title  = {Deep Speaker Verification: Do We Need End to End?},
  author = {Dong Wang and Lantian Li and Zhiyuan Tang and Thomas Fang Zheng},
  journal= {arXiv preprint arXiv:1706.07859},
  year   = {2017}
}