中文

基于重要性指导的大语言模型低秩分解基准选取

机器学习 2026-05-08 v2

摘要

低秩分解是压缩大型语言模型的引人注目的一种方法,但其有效性取决于为目标任务选择保留哪些奇异向量基。现有方法如 Basel 适应下游数据调整奇异值系数并剔除重学习后尺寸较小的基,属于经验性做法,可能因忽略损失景观的局部几何而偏离任务性能。我们提出基准选取与重要性(Basis Selection with Importance, BSI),这是一种原则性的低秩压缩框架,通过直接估计删除每个基准所导致的预期损失增量来对基准进行排序和剔除。BSI 基于任务损失关于奇异值的二阶泰勒展开推导导数-based 重要性得分,将一阶灵敏度与二阶曲率相结合,以量化修剪影响。为使此标准在大型语言模型中实用,我们开发了一种高效的 Hessian 对角估计器,通过改造 Hutchinson 随机探针方法以适用于损失曲率的对称参数扰动来实现。我们提供了全面的理论分析,包括在基准修剪下的损失增量上界、Hessian 对角估计误差在这些上界中的显式传播、与 Hessian 谱相关的方差特征、实现目标估计精度的高概率样本复杂度保证以及扰动强度指导。广泛的实验在数学推理基准测试上表明,BSI 在所有基于低秩分解的基线方法中 consistently 表现出色,尤其在深度压缩情境下取得显著提升。

关键词

引用

@article{arxiv.2605.01627,
  title  = {Importance-Guided Basis Selection for Low-Rank Decomposition of Large Language Models},
  author = {Daniel Agyei Asante and Ernie Chang and Yang Li},
  journal= {arXiv preprint arXiv:2605.01627},
  year   = {2026}
}