基于GNA的远场说话人识别结构化稀疏化
音频与语音处理
2020-02-18 v2 机器学习
摘要
近年来,深度神经网络(DNN)已广泛应用于说话人识别领域。为实现快速响应时间与高准确率,对硬件资源的需求迅速增长。然而,由于说话人识别应用常部署于移动设备,有必要在远场条件下保持低计算成本的同时维持高准确率。本文中,我们对时延神经网络(TDNN)施加结构化稀疏化以移除冗余结构并加速执行。在目标硬件上,我们的模型可移除60%的参数,且仅使等错误率(EER)略微上升0.18%,而我们的结构化稀疏模型可实现超过1.5倍的加速。
引用
@article{arxiv.1910.11488,
title = {Structural sparsification for Far-field Speaker Recognition with GNA},
author = {Jingchi Zhang and Jonathan Huang and Michael Deisher and Hai Li and Yiran Chen},
journal= {arXiv preprint arXiv:1910.11488},
year = {2020}
}
备注
submitted to icassp2020