中文

基于GNA的远场说话人识别结构化稀疏化

音频与语音处理 2020-02-18 v2 机器学习

摘要

近年来,深度神经网络(DNN)已广泛应用于说话人识别领域。为实现快速响应时间与高准确率,对硬件资源的需求迅速增长。然而,由于说话人识别应用常部署于移动设备,有必要在远场条件下保持低计算成本的同时维持高准确率。本文中,我们对时延神经网络(TDNN)施加结构化稀疏化以移除冗余结构并加速执行。在目标硬件上,我们的模型可移除60%的参数,且仅使等错误率(EER)略微上升0.18%,而我们的结构化稀疏模型可实现超过1.5倍的加速。

关键词

引用

@article{arxiv.1910.11488,
  title  = {Structural sparsification for Far-field Speaker Recognition with GNA},
  author = {Jingchi Zhang and Jonathan Huang and Michael Deisher and Hai Li and Yiran Chen},
  journal= {arXiv preprint arXiv:1910.11488},
  year   = {2020}
}

备注

submitted to icassp2020