中文

向量-向量-矩阵架构:一种用于NLP应用低延迟推理的新型硬件感知框架

计算与语言 2020-10-19 v1 硬件体系结构

摘要

深度神经网络已成为构建可靠自然语言处理(NLP)应用的标准方法,从神经机器翻译(NMT)到对话系统。然而,通过增大模型规模来提高准确率需要大量硬件计算,这会在推理时显著减慢NLP应用的速度。为解决此问题,我们提出了一种新颖的向量-向量-矩阵架构(VVMA),它大幅降低了NMT在推理时的延迟。该架构利用了具有低延迟向量-向量运算和较高延迟向量-矩阵运算的专用硬件。它还为几乎所有依赖高效矩阵乘法器的模型减少了参数数量和FLOPs,且不会显著影响准确率。我们给出的实证结果表明,我们的框架可将用于NMT的序列到序列和Transformer模型的延迟降低为原来的四分之一。最后,我们展示证据表明我们的VVMA可扩展到其他领域,并讨论了用于其高效使用的新型硬件。

关键词

引用

@article{arxiv.2010.08412,
  title  = {Vector-Vector-Matrix Architecture: A Novel Hardware-Aware Framework for Low-Latency Inference in NLP Applications},
  author = {Matthew Khoury and Rumen Dangovski and Longwu Ou and Preslav Nakov and Yichen Shen and Li Jing},
  journal= {arXiv preprint arXiv:2010.08412},
  year   = {2020}
}

备注

To appear at the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP '20), November 16-20, 2020, NMT, AI accelerators, co-design, TPU, OPU, 10 pages, 3 figures, 4 tables