中文

EdgeSpeechNets:面向边缘端语音识别的高效深度神经网络

音频与语音处理 2018-11-15 v2 机器学习 神经与进化计算 声音 信号处理 机器学习

摘要

尽管展现出最先进的性能,用于语音识别的深度学习在移动和其他消费设备等设备上边缘场景中部署仍然具有挑战性。最近,在设计更适合边缘设备的小型、低占用深度神经网络(DNNs)方面已有更多努力,其中许多聚焦于手工设计高效网络架构的设计原则。在本研究中,我们探索了一种人机协作设计策略,通过人类驱动的原则性网络设计原型与机器驱动的设计探索相结合,来构建用于语音识别的低占用DNN架构。该设计策略的有效性通过设计一系列用于有限词汇语音识别的极高效率DNN(昵称为EdgeSpeechNets)得到证明。使用Google Speech Commands数据集进行有限词汇语音识别的实验结果表明,EdgeSpeechNets比最先进(SOTA)的DNN具有更高准确率(最佳EdgeSpeechNet达到约97%准确率),同时实现显著更小的网络规模(小至多7.8倍)和更低计算成本(少至多36倍乘加运算、10倍更低预测延迟、以及在Motorola Moto E手机上16倍更小内存占用),使其非常适合于设备上边缘语音接口应用。

关键词

引用

@article{arxiv.1810.08559,
  title  = {EdgeSpeechNets: Highly Efficient Deep Neural Networks for Speech Recognition on the Edge},
  author = {Zhong Qiu Lin and Audrey G. Chung and Alexander Wong},
  journal= {arXiv preprint arXiv:1810.08559},
  year   = {2018}
}

备注

4 pages