OPAL:面向生成式大语言模型的保留异常值微缩放量化加速器
机器学习
2024-09-25 v3 硬件体系结构
计算与语言
摘要
为克服大语言模型(LLM)不断增长的规模对内存大小和带宽造成的负担,近期研究集中于激进的权重量化,但缺乏对激活值量化的研究。本文提出一种软硬件协同设计方法,设计了一款面向生成任务的高能效 LLM 加速器,名为 OPAL。首先,提出一种新颖的激活量化方法,该方法利用微缩放数据格式,同时在每个子张量块中保留若干异常值(例如,128 个元素中保留 4 个)。其次,在保留异常值的基础上,采用混合精度:对 LLM 解码器块中敏感层的输入使用 5 比特,而对不太敏感层的输入保持 3 比特。最后,我们提出 OPAL 硬件架构,该架构包含用于处理异常值的浮点单元和用于主导非异常值相关操作的向量化整数乘法器。此外,OPAL 对 softmax 操作采用基于 log2 的近似,仅需移位和减法即可最大化能效。结果表明,我们能够将能效提升 1.6~2.2 倍,面积减少 2.4~3.1 倍,且精度损失可忽略不计,即困惑度增加小于 1。
引用
@article{arxiv.2409.05902,
title = {OPAL: Outlier-Preserved Microscaling Quantization Accelerator for Generative Large Language Models},
author = {Jahyun Koo and Dahoon Park and Sangwoo Jung and Jaeha Kung},
journal= {arXiv preprint arXiv:2409.05902},
year = {2024}
}
备注
7 pages, 8 figures, DAC2024 accepted