Quaff:基于异常空间稳定性假设的参数高效量化微调
机器学习
2025-06-02 v2 人工智能
摘要
大型语言模型(LLMs)在各个领域取得了令人振奋的成就,但由于任务特定微调的计算和内存需求昂贵,仍难以在资源受限的个人设备上部署。虽然量化提供了一种效率路径,但现有方法在性能和开销之间难以平衡,要么计算和内存成本高,要么未能解决激活异常的问题,这在量化微调中是一个关键瓶颈。为解决这些挑战,我们提出了异常空间稳定性假设(OSSH):在微调期间,某些激活异常通道在训练迭代过程中保持稳定的空间位置。基于OSSH,我们提出了Quaff——面向大型语言模型的参数高效量化微调框架,通过针对性动量缩放优化低精度激活表示。Quaff动态抑制不变通道中的异常,仅使用轻量级操作,消除全精度权重存储和全局重新标度,同时降低量化误差。广泛的十个基准实验验证了OSSH并证明了Quaff的有效性。具体而言,在GPQA推理基准测试中,Quaff相对于全精度微调实现了1.73倍的延迟降低和30%的内存节省,同时在Phi-3模型上提高了0.6%的准确率,实现了效率、性能和可部署性之间的三方权衡。通过使消费级GPU(如RTX 2080 Super)无需牺牲模型效用即可进行微调,Quaff实现了个人化LLM部署的民主化。代码已公开:https://github.com/Little0o0/Quaff.git
引用
@article{arxiv.2505.14742,
title = {Quaff: Quantized Parameter-Efficient Fine-Tuning under Outlier Spatial Stability Hypothesis},
author = {Hong Huang and Dapeng Wu},
journal= {arXiv preprint arXiv:2505.14742},
year = {2025}
}
备注
Accepted by ACL 2025