大型语言模型 (LLM) 中的二次幂 (PoT) 权重
信号处理
2025-06-03 v1 机器学习
摘要
由于模型参数的大幅增加,神经网络的复杂性正迅速增长。具体而言,在大型语言模型 (LLM) 中,模型参数数量在过去几年呈指数级增长,例如从 GPT2 的 15 亿参数增长到 GPT3 的 175 亿参数。这给实现带来了重大挑战,尤其是对于内存和处理能力非常有限的边缘设备。在这项工作中,我们研究通过一种特殊类型的量化——二次幂 (PoT),对线性层权重和 transformer 表进行 LLM 复杂度缩减。PoT 不仅减少了内存,更重要的是通过将乘法转换为移位操作显著降低了计算量。我们在使用 Shakespeare 数据集的 Nano-GPT 实现上获得了 PoT 量化的初步结果。随后我们将结果扩展到 124-M GPT-2 模型。PoT 量化的结果非常有前景,在用 [4-6] 比特范围表示幂级时,交叉熵损失退化 [1.3-0.88]。
引用
@article{arxiv.2506.00315,
title = {Power-of-Two (PoT) Weights in Large Language Models (LLMs)},
author = {Mahmoud Elgenedy},
journal= {arXiv preprint arXiv:2506.00315},
year = {2025}
}