中文

KaSA: 基于知识感知奇异值适应的大语言模型

计算与语言 2025-03-03 v2 人工智能 机器学习

摘要

大语言模型 (LLM) 的规模不断增大, 导致在为这些模型的特定任务或领域进行适应时存在显著的计算开销和内存使用。已发明了各种参数高效微调 (PEFT) 方法来缓解这些挑战, 通过训练少量参数来进行模型权重的任务特定更新。尽管如此, LoRA 及其后继方法忽略了噪声或不相关于目标任务的知识, 不利于模型性能, 导致亚最优。为此, 我们引入知识感知奇异值适应 (KaSA), 一种利用奇异值分解 (SVD) 带有知识感知奇异值的 PEFT 方法, 以根据其与目标任务的相关性动态激活知识。我们在大范围的 LLMs 上进行了实验, 涵盖自然语言理解 (NLU)、生成 (NLG)、指令遵循和常识推理等任务。实验结果表明, KaSA 在 16 个基准测试和 4 个合成数据集上 consistently 超过 FFT 和 14 个流行的 PEFT 基线, 凸显了该方法的有效性和适应性。我们的 方法的源代码可在 https://github.com/juyongjiang/KaSA 上获得。

关键词

引用

@article{arxiv.2412.06071,
  title  = {KaSA: Knowledge-Aware Singular-Value Adaptation of Large Language Models},
  author = {Fan Wang and Juyong Jiang and Chansung Park and Sunghun Kim and Jing Tang},
  journal= {arXiv preprint arXiv:2412.06071},
  year   = {2025}
}

备注

The first three authors contributed equally to this work; Accepted by ICLR 2025