GOBO:量化基于注意力的NLP模型以实现低延迟与高能效推理
机器学习
2022-03-25 v2 硬件体系结构
机器学习
摘要
基于注意力的模型已在各种自然语言理解任务中展现出显著成功。然而,由于其海量参数导致的存储器受限特性,高效执行对这些模型而言仍具挑战。我们提出 GOBO,一种模型量化技术,将最先进的 BERT 模型及其变体中绝大多数(通常 99.9%)的 32 位浮点参数压缩至 3 位,同时保持其精度。与其他量化方法不同,GOBO 不需要微调或重训练来补偿量化误差。我们给出 GOBO 的两个实用硬件应用。在第一种中,GOBO 减少存储器和存储器流量,从而降低推理延迟和能耗。该 GOBO 存储器压缩机制与许多架构插件兼容;我们使用 TPU、Eyeriss 和采用类 Tensor Cores 单元的架构进行演示。第二,我们提出一种协同设计的硬件架构,其同时减少计算。独特的是,GOBO 架构即使在计算期间也将大多数权重保持在 3b,这一特性:(1)使处理单元面积高效,允许每单位面积封装更多算力,(2)以加法替代大多数乘累加,(3)通过放大片上存储器容量来减少片外流量。
引用
@article{arxiv.2005.03842,
title = {GOBO: Quantizing Attention-Based NLP Models for Low Latency and Energy Efficient Inference},
author = {Ali Hadi Zadeh and Isak Edo and Omar Mohamed Awad and Andreas Moshovos},
journal= {arXiv preprint arXiv:2005.03842},
year = {2022}
}
备注
Accepted at the 53rd IEEE/ACM International Symposium on Microarchitecture - MICRO 2020