中文

大语言模型上的 Kronecker 适应型奇异值分解

机器学习 2025-06-19 v1 人工智能

摘要

大型预训练 Transformer 模型在多样化的语言和推理任务上实现了最先进的性能,但完整微调会带来巨大的存储、内存和计算开销。参数高效微调 (PEFT) 方法通过仅学习小部分任务特定参数来缓解这些成本,但现有方法要么引入推理时延迟 (adapter 模块),要么 suffer from 次优收敛 (随机初始化的低秩更新),或依赖固定秩选择,这可能不匹配任务复杂度 (Kronecker 基 decomposition)。我们提出 SoKA (SVD on Kronecker Adaptation),一种新的 PEFT 策略,将 Kronecker 积张量分解与 SVD 驱动初始化和能谱感知动态秩选择相结合。我们的Kronecker-Product SVD (KPSVD) 程序从完整权重更新中提取主成分,构成紧凑的 Kronecker 因子;而自适应秩选择算法则采用能量阈值和肘点准则对不显著的成分进行修剪。在 LLaMA2-7B 上进行的实验表明,SoKA 只需 0.99M 可训练参数,比 LoRA/PiSSA 少 25%,同时在匹配或超越基线性能方面表现出色。此外,SoKA 具有更快的收敛速度和更稳定的梯度,凸显其在大规模模型适应方面的鲁棒性和效率。

关键词

引用

@article{arxiv.2506.15251,
  title  = {Singular Value Decomposition on Kronecker Adaptation for Large Language Model},
  author = {Yee Hin Chong and Peng Qu},
  journal= {arXiv preprint arXiv:2506.15251},
  year   = {2025}
}