中文

PEFT 技术用于 LLM 的优劣实证分析

计算与语言 2023-05-01 v1 人工智能

摘要

随着基础模型的规模持续呈指数级增长,高效的适配方法变得愈发关键。参数高效微调(PEFT)作为近期一类仅需修改模型参数极小比例的技术,是当前适配大语言模型(LLM)最流行的方法。近期提出了若干 PEFT 技术,各有不同的权衡。我们针对一个具代表性的 LLM——FLAN-T5 模型,提供了各类 PEFT 技术的全面且统一的基准测试,并在分类与生成数据集的不同数据规模上评估模型性能。基于此,我们提供了一个根据任务类型与数据可用性选择最优微调技术的框架。与普遍看法相反,我们还通过实证证明在低数据场景下 PEFT 技术比全量微调收敛更慢,并给出了 PEFT 方法既能表现良好又能高效收敛所需的数据量。最后,我们通过选择性地确定模型中需训练的部分来进一步优化这些 PEFT 技术,并发现这些技术可在参数显著更少的情况下应用,同时保持甚至提升性能。

关键词

引用

@article{arxiv.2304.14999,
  title  = {Empirical Analysis of the Strengths and Weaknesses of PEFT Techniques for LLMs},
  author = {George Pu and Anirudh Jain and Jihan Yin and Russell Kaplan},
  journal= {arXiv preprint arXiv:2304.14999},
  year   = {2023}
}

备注

Short paper, ICLR '23 Workshop on Understanding Foundation Models