中文

ESE:基于FPGA上稀疏LSTM的高效语音识别引擎

计算与语言 2017-02-21 v2

摘要

长短期记忆(LSTM)广泛用于语音识别。为了获得更高的预测精度,机器学习科学家构建了越来越大的模型。此类大模型既是计算密集型也是内存密集型。部署此类庞大模型导致高功耗,并导致数据中心总拥有成本(TCO)高。为了加速预测并使其节能,我们首先提出一种负载均衡感知的剪枝方法,可将 LSTM 模型大小压缩 20 倍(来自剪枝的 10 倍和来自量化的 2 倍),且预测精度损失可忽略。剪枝后的模型利于并行处理。接下来,我们提出调度器,将压缩模型编码并划分到每个 PE 以实现并行,并调度复杂的 LSTM 数据流。最后,我们设计名为高效语音识别引擎(ESE)的硬件架构,其直接在压缩模型上工作。在运行于 200MHz 的 Xilinx XCKU060 FPGA 上实现,ESE 在压缩 LSTM 网络上直接工作达到 282 GOPS 性能,对应于未压缩网络上的 2.52 TOPS,并以 41 瓦功耗处理完整的 LSTM 用于语音识别。在 LSTM 语音识别基准上评估,ESE 比 Core i7 5930k CPU 和 Pascal Titan X GPU 实现分别快 43 倍和 3 倍。与 CPU 和 GPU 相比,它分别实现了 40 倍和 11.5 倍更高的能效。

关键词

引用

@article{arxiv.1612.00694,
  title  = {ESE: Efficient Speech Recognition Engine with Sparse LSTM on FPGA},
  author = {Song Han and Junlong Kang and Huizi Mao and Yiming Hu and Xin Li and Yubin Li and Dongliang Xie and Hong Luo and Song Yao and Yu Wang and Huazhong Yang and William J. Dally},
  journal= {arXiv preprint arXiv:1612.00694},
  year   = {2017}
}

备注

Accepted as full paper in FPGA'17, Monterey, CA; Also appeared at 1st International Workshop on Efficient Methods for Deep Neural Networks at NIPS 2016, Barcelona, Spain