Mokey:为开箱即用的浮点 Transformer 模型实现窄定点推理
机器学习
2022-06-07 v1 硬件体系结构
摘要
越来越大且更优的 Transformer 模型不断推动自然语言处理应用的最高精度与能力。这些模型需要更多的算力、存储和能耗。Mokey 通过将所有数值量化为指向 16 位定点质心字典的 4 位索引,来缩减最先进的 32 位或 16 位浮点 transformer 模型的占用。Mokey 无需微调,这是一项关键特性,因为许多情况下训练资源或数据集往往并不可用。利用 transformer 模型中自然出现的数值范围,Mokey 选取质心值以同时拟合一条指数曲线。这一独特特性使 Mokey 能够将大部分原有的乘累加操作替换为窄 3 位定点加法,从而得出一种面积与能耗高效的硬件加速器设计。在一组最先进的 transformer 模型上,Mokey 加速器相较基于 Tensor Cores 的加速器实现了数量级的能效提升,同时将性能提高至少 至多 (取决于模型与片上缓冲容量)。可选地,Mokey 可用作任何其他加速器的内存压缩辅助,以透明方式将宽浮点或定点激活值或权重暂存为窄 4 位索引。Mokey 被证明优于先前最先进的 Transformer 量化方法。
引用
@article{arxiv.2203.12758,
title = {Mokey: Enabling Narrow Fixed-Point Inference for Out-of-the-Box Floating-Point Transformer Models},
author = {Ali Hadi Zadeh and Mostafa Mahmoud and Ameer Abdelhadi and Andreas Moshovos},
journal= {arXiv preprint arXiv:2203.12758},
year = {2022}
}
备注
Accepted at the 49th IEEE/ACM International Symposium on Computer Architecture (ISCA '22)