中文

用于说话人确认的二值神经网络

声音 2021-04-07 v1 机器学习 音频与语音处理

摘要

尽管深度神经网络在语音领域的许多任务中取得成功,但其高计算与内存成本使得难以直接将高性能神经网络系统部署于低资源嵌入式设备。存在若干减小神经网络规模的机制,如参数剪枝、参数量化等。本文关注如何将二值神经网络应用于说话人确认任务。所提出的训练参数二值化可在显著减少存储空间需求与计算成本的同时,较大程度保持性能。实验结果表明,在将卷积神经网络二值化后,基于ResNet34的网络在Voxceleb1测试数据集上取得了约5%的EER,并在文本相关数据集Xiaole上甚至优于传统的实数网络,同时实现了32倍的内存节省。

关键词

引用

@article{arxiv.2104.02306,
  title  = {Binary Neural Network for Speaker Verification},
  author = {Tinglong Zhu and Xiaoyi Qin and Ming Li},
  journal= {arXiv preprint arXiv:2104.02306},
  year   = {2021}
}