广义Fisher加权奇异值分解:用于压缩大型语言模型的可扩展Kronecker因子化Fisher近似
机器学习
2025-05-26 v1 人工智能
摘要
Fisher信息是衡量神经网络参数敏感性的基本概念。然而,针对大型模型利用完整观察Fisher信息的成本过高,因此大多数方法依赖简单对角近似。虽然这种方法高效,但忽略了参数之间的相关性,常导致在下游任务上性能下降。本文缓解了这些限制,提出广义Fisher加权奇异值分解(GFWSVD),这是一种后训练的大型语言模型压缩技术,既考虑对角元素又考虑非对角元素的Fisher信息矩阵,从而更准确地反映参数重要性。为使方法可行,我们引入了观察Fisher信息的Kronecker因子化近似算法的可扩展变体。在大型语言模型压缩方面展示了我们方法的有效性,显示在MMLU基准测试中以20倍压缩率下的表现,相较于基于Fisher信息对角近似的FWSVD提升5个百分点,相较于SVD-LLM提升3个百分点,相较于ASVD提升6个百分点。
引用
@article{arxiv.2505.17974,
title = {Generalized Fisher-Weighted SVD: Scalable Kronecker-Factored Fisher Approximation for Compressing Large Language Models},
author = {Viktoriia Chekalina and Daniil Moskovskiy and Daria Cherniuk and Maxim Kurkin and Andrey Kuznetsov and Evgeny Frolov},
journal= {arXiv preprint arXiv:2505.17974},
year = {2025}
}