DFRot:通过精细旋转实现无异常值和无大量激活的旋转 LLM
摘要
最近,一种通过旋转激活矩阵和权重矩阵以减少大语言模型(LLM)中异常值的影响的技术引起了广泛关注,尤其是在模型量化的背景下。先前的研究表明,在低精度量化场景下,例如 4 位权重和 4 位激活(W4A4),随机哈达巴尔变换的准确率显著高于随机正交变换。值得注意的是,这种现象背后的原因尚不明确。本文发现,这些变换在消除常见 token 的异常值方面显示出显著的改进,并且实现了类似的量化误差。准确度差异的主要原因在于,随机哈达巴尔变换对大量激活的 token 略微降低了量化误差,而随机正交变换则增加了这些 token 的量化误差。由于这些 token 极其罕见且对模型准确率影响关键,我们将其视为一种长尾优化问题,因此构建了一个简单而有效的方法:加权损失函数。此外,我们提出了一种针对旋转矩阵的优化策略,通过交替优化量化参数并采用正交 Procrustes 变换来精炼旋转矩阵。这使得旋转后激活值的分布更有利于量化,尤其是针对大量激活的 token。我们的 метод使 Rotated LLM 实现了双重免疫:无异常值(Outlier-Free)和无大量激活(Massive Activation-Free),称为 DFRot。广泛的实验表明,DFRot 的有效性和效率。通过仅使用单个样本调整旋转矩阵,DFRot 在 LLaMA3-70B 上(一种因量化问题而言较具挑战性的模型),在 W4A4KV4 和 W4A4KV16 上分别实现了约 0.98 和 0.95 的困惑度提升。
引用
@article{arxiv.2412.00648,
title = {DFRot: Achieving Outlier-Free and Massive Activation-Free for Rotated LLMs with Refined Rotation},
author = {Jingyang Xiang and Sai Qian Zhang},
journal= {arXiv preprint arXiv:2412.00648},
year = {2025}
}
备注
Accepeted bythe 2nd Conference on Language Modeling (COLM 2025). Source code \url{https://github.com/JingyangXiang/DFRot}