最优奇异损伤:低存储 regime 下的高效 LLM 推理
计算与语言
2025-11-05 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)正在跨越 diverse applications 日益普及。然而,其巨大的尺寸限制了存储和处理能力,仅剩一小部分 well-resourced 利益相关者能够受益。结果,大多数应用依赖于预训练的 LLMs,针对 specific tasks 进行微调。然即使存储这些模型的微调版本也仍是一个 significant 挑战 due to the wide range of tasks they address。最近的研究表明,微调这些模型主要影响其中的 small fraction 参数,凸显了对微调模型存储效率的需求。本文聚焦于预训练模型进行微调后参数更新的高效存储。为解决这一挑战,我们利用微调更新既 low-rank 又 sparse 的观察,这可以用于 storage efficiency。然而,仅使用 low-rank 近似或稀疏化可能会丢弃增强模型 expressivity 的关键奇异组件。我们首先观察到,在相同的 memory budget 下,稀疏化 low-rank 近似(具有更大秩)的性能优于 standard low-rank 近似(具有较小秩)。基于此,我们提出了我们的方法 optimal singular damage,通过利用奇异向量的交错重要性来 selectively 稀疏化 low-rank 近似的更新,确保保留最具影响的组件。我们通过 extensive 实验表明,我们的 proposed 方法在相同的 memory budget 下实现显著的 storage efficiency 和 superior 准确性,优于仅采用 low-rank 近似或稀疏化。
引用
@article{arxiv.2511.02681,
title = {Optimal Singular Damage: Efficient LLM Inference in Low Storage Regimes},
author = {Mohammadsajad Alipour and Mohammad Mohammadi Amiri},
journal= {arXiv preprint arXiv:2511.02681},
year = {2025}
}