为量化矩阵与低秩矩阵分配不同角色以实现最优权重分解
机器学习
2025-06-04 v1 人工智能
计算与语言
摘要
将权重矩阵分解为量化和低秩组件()是压缩大语言模型(LLM)的广泛使用技术。现有的联合优化方法在量化和低秩近似之间迭代交替。然而,这些方法倾向于以牺牲一个组件为代价来优先考虑另一个组件,导致次优的分解,无法发挥每个组件的独特优势。在本工作中,我们引入了异常值驱动的低秩初始化(ODLRI),将捕获对激活敏感的权重的特定角色分配给低秩组件。这种结构化分解减轻了异常值对量化的负面影响,在量化和低秩近似之间实现了更有效的平衡。在 Llama2(7B、13B、70B)、Llama3-8B 和 Mistral-7B 上的实验表明,将 ODLRI 纳入联合优化框架可持续减少激活感知误差,最小化量化尺度,并改善低比特设置下的困惑度和零样本准确率。
引用
@article{arxiv.2506.02077,
title = {Assigning Distinct Roles to Quantized and Low-Rank Matrices Toward Optimal Weight Decomposition},
author = {Yoonjun Cho and Soeun Kim and Dongjae Jeon and Kyelim Lee and Beomsoo Lee and Albert No},
journal= {arXiv preprint arXiv:2506.02077},
year = {2025}
}
备注
Accepted to Findings of ACL 2025