BitMoD:面向 LLM 加速的比特串行数据类型混合
机器学习
2025-04-29 v2 硬件体系结构
摘要
大型语言模型(LLM)在各种机器学习任务中展现出了卓越的性能。然而,LLM 庞大的内存占用严重阻碍了其部署。本文通过 BitMoD 这一软硬件协同设计方案,在低权重精度下实现高效的 LLM 加速,从而提升了 LLM 的可及性。在算法层面,BitMoD 引入了细粒度数据类型自适应,即使用不同的数值数据类型对一组(例如 128 个)权重进行量化。通过精心设计这些新数据类型,BitMoD 能够在保持高精度的同时,将 LLM 权重量化至极低精度(例如 4 比特和 3 比特)。在硬件层面,BitMoD 采用比特串行处理单元以轻松支持多种数值精度和数据类型;其硬件设计包含两项关键创新:首先,采用统一表示来处理不同的权重数据类型,从而降低硬件开销;其次,采用比特串行反量化单元,以最小的硬件开销对逐组部分和进行重新缩放。在六个代表性 LLM 上的评估表明,BitMoD 显著优于当前最先进的 LLM 量化与加速方法。对于判别式任务,BitMoD 可将 LLM 权重量化至 4 比特,平均精度损失 。对于生成式任务,BitMoD 能够将 LLM 权重量化至 3 比特,同时获得优于先前 LLM 量化方案的困惑度。结合卓越的模型性能与高效的加速器设计,与先前的 LLM 加速器 ANT 和 OliVe 相比,BitMoD 分别实现了平均 和 的加速比。
引用
@article{arxiv.2411.11745,
title = {BitMoD: Bit-serial Mixture-of-Datatype LLM Acceleration},
author = {Yuzong Chen and Ahmed F. AbouElhamayed and Xilai Dai and Yang Wang and Marta Andronic and George A. Constantinides and Mohamed S. Abdelfattah},
journal= {arXiv preprint arXiv:2411.11745},
year = {2025}
}
备注
HPCA 2025