中文

基于GE2E方法的文本无关说话人确认实证研究

音频与语音处理 2022-03-01 v4 人工智能 计算与语言 机器学习

摘要

尽管说话人识别领域的许多研究者已开始用深度学习技术取代以往经典的最先进方法,一些传统的基于i-vector的方法在文本无关说话人确认中仍是最先进的。谷歌提出的用于说话人确认的广义端到端损失(Generalized End-to-End Loss for Speaker Verification, GE2E)是一种使用长短期记忆单元的深度学习技术,因其收敛速度与泛化能力近来备受关注。本研究旨在进一步研究GE2E方法并比较不同场景,以考察其各方面特性。本文讨论了多项实验,包括测试与注册语句随机采样、测试语句时长以及注册语句数量的影响。此外,我们将GE2E方法与文本无关说话人确认的基线最先进基于i-vector的方法进行比较,结果表明该方法以更低的错误率优于后者,同时具备端到端特性且收敛所需训练时间更短。

关键词

引用

@article{arxiv.2011.04896,
  title  = {An Empirical Study on Text-Independent Speaker Verification based on the GE2E Method},
  author = {Soroosh Tayebi Arasteh},
  journal= {arXiv preprint arXiv:2011.04896},
  year   = {2022}
}

备注

6 pages, 7 tables, 2 figures, 4 algorithms. An empirical study on the paper arXiv:1710.10467 by Wan et al. (2017)