Transformer 中非线性操作的遗传量化感知近似
机器学习
2024-04-01 v2 硬件体系结构
神经与进化计算
摘要
非线性函数在 Transformer 及其轻量级变体中普遍存在,带来了巨大且常被低估的硬件开销。先前的 SOTA 工作通过分段线性近似优化这些操作,并将参数存储在查找表(LUT)中,但其中大多数需要不友好的高精度算术(如 FP/INT 32),且缺乏对仅整数 INT 量化的考虑。本文提出了一种名为 GQA-LUT 的遗传 LUT 近似算法,能够自动确定具有量化感知的参数。结果表明,GQA-LUT 在具有挑战性的语义分割任务上,对于普通和线性 Transformer 模型均实现了可忽略不计的性能下降。此外,所提出的 GQA-LUT 使得采用基于 INT8 的 LUT 近似成为可能,与高精度 FP/INT 32 替代方案相比,实现了 81.3~81.7% 的面积节省和 79.3~80.2% 的功耗降低。代码可在 https:// github.com/PingchengDong/GQA-LUT 获取。
关键词
引用
@article{arxiv.2403.19591,
title = {Genetic Quantization-Aware Approximation for Non-Linear Operations in Transformers},
author = {Pingcheng Dong and Yonghao Tan and Dong Zhang and Tianwei Ni and Xuejiao Liu and Yu Liu and Peng Luo and Luhong Liang and Shih-Yang Liu and Xijie Huang and Huaiyu Zhu and Yun Pan and Fengwei An and Kwang-Ting Cheng},
journal= {arXiv preprint arXiv:2403.19591},
year = {2024}
}
备注
61st ACM/IEEE Design Automation Conference (DAC) 2024