紧凑说话人嵌入:lrx-vector
音频与语音处理
2020-08-13 v1 计算与语言
机器学习
声音
摘要
深度神经网络(DNN)近来已广泛应用于说话人识别系统,在各种基准上取得了最先进的性能。x-vector 架构因其优异的性能和可控的计算复杂度在该研究界尤为流行。本文提出 lrx-vector 系统,它是 x-vector 嵌入网络的低秩分解版本。该拓扑结构的主要目标是进一步降低说话人识别系统的内存需求。我们讨论了使用知识蒸馏训练 lrx-vector 系统,并与基于 SVD 的低秩分解进行比较。在 VOiCES 2019 远场语料库上,与全秩 x-vector 系统相比,我们能够在保持识别率不变(1.83% EER)的情况下将权重减少 28%。
引用
@article{arxiv.2008.05011,
title = {Compact Speaker Embedding: lrx-vector},
author = {Munir Georges and Jonathan Huang and Tobias Bocklet},
journal= {arXiv preprint arXiv:2008.05011},
year = {2020}
}
备注
Accepted to INTERSPEECH 2020