中文

通过子空间中的反卷积对大型语言模型进行参数高效微调

计算与语言 2025-03-04 v1 人工智能

摘要

大型语言模型(LLM)被视为实现人工通用智能(AGI)的里程碑。凭借其先进的涌现能力,LLM 能够适应广泛的具体应用。针对各种下游任务对 LLM 进行微调已成为一种新范式。低秩适应(LoRA)因其参数高效性而闻名,可将针对 LLM 微调所需的参数数量降低几个数量级。然而,LoRA 基于的方法因秩一分解所施加的瓶颈而面临重大限制。随着 LLM 参数数量的增加,即使是秩一分解也可能超过处理更多下游任务真正所需的参数数量。本文提出了一种新的参数高效微调(PEFT)方法,通过子空间中的反卷积,称为 DCFT。我们创新性地使用反卷积来完成细节并增强子空间递增矩阵中的知识,通过调整 kernel 大小动态控制参数,这不受秩一分解的限制。对 DCFT 进行了大量实验以验证其有效性。结果显示,与 LoRA 相比,DCFT 实现了约 8 倍的参数降低,仍实现了令人印象深刻的性能。我们的代码可在 https://github.com/Godz-z/DCFT 查看。

关键词

引用

@article{arxiv.2503.01419,
  title  = {Parameter-Efficient Fine-Tuning of Large Language Models via Deconvolution in Subspace},
  author = {Jia-Chen Zhang and Yu-Jie Xiong and Chun-Ming Xia and Dong-Hai Zhu and Xi-He Qiu},
  journal= {arXiv preprint arXiv:2503.01419},
  year   = {2025}
}

备注

COLING 2025 main conference