FLARE:基于无浮点运算的 PTQ 与低 ENOB ADC 应用 AMS-PiM 实现面向 Transformer 的高效、容错加速
机器学习
2024-11-25 v1 系统与控制
图像与视频处理
系统与控制
摘要
基于编码器的 Transformer 由自注意力层驱动,已通过其上下文感知表示 revolutionized 机器学习,但其在计算和内存需求上的二次增长 presents significant bottlenecks。模拟-混合信号过程内存储 (AMS-PiM) 架构通过实现芯内高效处理来解决这些挑战。传统 AMS-PiM 依赖于量化感知训练 (QAT),该方法在硬件上高效但需要 extensive retraining to adapt models to AMS-PiMs,使其对于 Transformer 模型变得日益不实用。后训练量化 (PTQ) 缓解了此训练开销,但引入显著硬件效率低下。PTQ 依赖于去量化-量化 (DQ-Q) 过程、浮点单元 (FPU) 和高 ENOB (有效位数) 模数-数模转换器 (ADC)。特别是,高 ENOB ADC 在面积和能耗上呈指数增长 (),降低感知裕度,并增加对工艺、电压和温度 (PVT) 变动的敏感性,进一步加剧了 AMS-PiM 系统中 PTQ 的挑战。为克服这些限制,我们提出了 RAP 架构,该架构消除 DQ-Q 过程,引入无 FPU 和除法的非线性处理,并采用基于低 ENOB ADC 的稀疏矩阵向量乘法技术。通过所提方法,RAP 在错误容错性、面积/能耗效率和计算速度方面均有所提升,同时保持数值稳定性。实验结果表明,RAP 在能耗、延迟和精度方面均优于最先进的 GPU 和常规 PiM 架构,成为面向 Transformer 高效部署的可扩展解决方案。
引用
@article{arxiv.2411.14733,
title = {FLARE: FP-Less PTQ and Low-ENOB ADC Based AMS-PiM for Error-Resilient, Fast, and Efficient Transformer Acceleration},
author = {Donghyeon Yi and Seoyoung Lee and Jongho Kim and Junyoung Kim and Sohmyung Ha and Ik Joon Chang and Minkyu Je},
journal= {arXiv preprint arXiv:2411.14733},
year = {2024}
}