中文

紧凑说话人嵌入:lrx-vector

音频与语音处理 2020-08-13 v1 计算与语言 机器学习 声音

摘要

深度神经网络(DNN)近来已广泛应用于说话人识别系统,在各种基准上取得了最先进的性能。x-vector 架构因其优异的性能和可控的计算复杂度在该研究界尤为流行。本文提出 lrx-vector 系统,它是 x-vector 嵌入网络的低秩分解版本。该拓扑结构的主要目标是进一步降低说话人识别系统的内存需求。我们讨论了使用知识蒸馏训练 lrx-vector 系统,并与基于 SVD 的低秩分解进行比较。在 VOiCES 2019 远场语料库上,与全秩 x-vector 系统相比,我们能够在保持识别率不变(1.83% EER)的情况下将权重减少 28%。

关键词

引用

@article{arxiv.2008.05011,
  title  = {Compact Speaker Embedding: lrx-vector},
  author = {Munir Georges and Jonathan Huang and Tobias Bocklet},
  journal= {arXiv preprint arXiv:2008.05011},
  year   = {2020}
}

备注

Accepted to INTERSPEECH 2020