中文

面向紧凑、精确且执行高效的 LSTM 的硬件引导共生训练

神经与进化计算 2019-01-31 v1

摘要

许多长短期记忆(LSTM)应用需要快速且紧凑的模型。神经网络压缩方法, 如 grow-and-prune 范式, 已证明可通过跳过不显著的权重来降低网络复杂度。然而, 当前的压缩策略大多是硬件无关的, 且网络复杂度的降低并不总转化为执行效率。在这项工作中, 我们提出了一种硬件引导的共生训练方法, 用于得到紧凑、精确且执行高效的推理模型。该方法基于我们的观察: 硬件在评估网络规模与推理延迟时可能引入显著的非单调行为, 我们称之为延迟迟滞效应。这一观察对主流的“更小维度更好”的压缩策略提出了质疑, 该策略常导致次优的模型架构。通过利用受硬件影响的迟滞效应与稀疏性, 我们能够实现模型紧凑性、准确性与执行效率的共生, 从而在提升 LSTM 精度的同时降低其延迟。我们在语言建模与语音识别应用上评估了我们的算法。相对于为 Penn Treebank 数据集得到的传统堆叠 LSTM 架构, 我们在 Nvidia GPU(Intel Xeon CPU)上将参数数量减少了 18.0 倍(30.5 倍), 并将实测运行延迟降低了至多 2.4 倍(5.2 倍), 且无任何精度下降。对于为 AN4 数据集得到的 DeepSpeech2 架构, 我们在 Nvidia GPU(Intel Xeon CPU)上将参数数量减少了 7.0 倍(19.4 倍), 词错误率从 12.9% 降至 9.9%(10.4%), 并将实测运行延迟降低了至多 1.7 倍(2.4 倍)。因此, 我们的方法产出了紧凑、精确且执行高效的推理模型。

关键词

引用

@article{arxiv.1901.10997,
  title  = {Hardware-Guided Symbiotic Training for Compact, Accurate, yet Execution-Efficient LSTM},
  author = {Hongxu Yin and Guoyang Chen and Yingmin Li and Shuai Che and Weifeng Zhang and Niraj K. Jha},
  journal= {arXiv preprint arXiv:1901.10997},
  year   = {2019}
}