中文

TinySpeech:面向边缘设备深度语音识别神经网络的注意力凝聚器

音频与语音处理 2020-10-14 v6 机器学习 神经与进化计算

摘要

深度学习的进展已在众多语音识别任务中带来最先进的性能。然而,深度神经网络在设备端语音识别中的广泛部署仍具挑战,尤其在内存与计算资源高度受限的边缘场景(例如低功耗嵌入式设备),或专用于语音识别的内存与计算预算较低时(例如除语音识别外还执行众多任务的移动设备)。在本研究中,我们引入注意力凝聚器的概念,以构建用于边缘设备端语音识别的低占用、高效率深度神经网络。注意力凝聚器是一种自注意力机制,学习并产生表征联合局部与跨通道激活关系的凝聚嵌入,并据此执行选择性注意力。为阐明其效能,我们提出 TinySpeech,即主要由注意力凝聚器构成的低精度深度神经网络,采用机器驱动设计探索策略定制用于设备端语音识别,其中一款专门针对微控制器运行约束设计。在 Google Speech Commands 基准数据集上针对限词汇量语音识别的实验结果表明,与先前工作相比,TinySpeech 网络实现了显著更低的架构复杂度(最多少 507×507\times 参数)、更低的计算复杂度(最多少 48×48\times 乘加运算)以及更低的存储需求(最多低 2028×2028\times 权重内存需求)。这些结果不仅证明了注意力凝聚器在构建高效设备端语音识别网络中的效能,也揭示了其在加速边缘深度学习及赋能 TinyML 应用方面的潜力。

关键词

引用

@article{arxiv.2008.04245,
  title  = {TinySpeech: Attention Condensers for Deep Speech Recognition Neural Networks on Edge Devices},
  author = {Alexander Wong and Mahmoud Famouri and Maya Pavlova and Siddharth Surana},
  journal= {arXiv preprint arXiv:2008.04245},
  year   = {2020}
}

备注

10 pages