中文

借助 GPU 加速释放 i-向量的未用潜力

机器学习 2019-06-21 v1 声音 音频与语音处理 机器学习

摘要

说话人嵌入是连续值向量表示,可通过简单几何运算轻松比较不同说话人的声音。其中,i-vector 与 x-vector 已成为说话人嵌入的主流方法。在本文中,我们展示了利用现代计算平台发挥 GPU 加速对 i-vector 提取的优势。特别地,相较于实时,我们在帧后验计算上实现了 3000 倍加速,而相较于 Kaldi 工具箱的 CPU 基线,训练 i-vector 提取器实现了 25 倍加速。这一显著加速使得探索此前不可能的想法成为可能。我们尤其表明,在训练 i-vector 提取器时更新通用背景模型(UBM)并重新计算帧对齐是有益的。此外,我们能够比以往更严谨地研究 i-vector 提取器的不同变体。在此过程中,我们揭示了 Kaldi 的 i-vector 提取器一些未文档化的细节,并表明在 VoxCeleb 说话人验证协议下,它比标准公式高出 1% 至 2% 的边际。我们所有发现均通过对多次随机起始运行结果进行集成平均得以验证。

关键词

引用

@article{arxiv.1906.08556,
  title  = {Unleashing the Unused Potential of I-Vectors Enabled by GPU Acceleration},
  author = {Ville Vestman and Kong Aik Lee and Tomi H. Kinnunen and Takafumi Koshinaka},
  journal= {arXiv preprint arXiv:1906.08556},
  year   = {2019}
}

备注

Accepted to Interspeech 2019