LLM-Adapters:面向大语言模型参数高效微调的适配器族
摘要
GPT-4 和 ChatGPT 等大语言模型(LLMs)的成功,催生了众多经济高效且易于获取的替代模型,它们通过对开放获取的 LLM 进行任务特定数据(如 ChatDoctor)或指令数据(如 Alpaca)微调而创建。在各种微调方法中,基于适配器的参数高效微调(PEFT)无疑是最引人关注的方向之一,因为它仅需微调少量外部参数而非整个 LLM,同时取得可比甚至更优的性能。为进一步推动 LLM 的 PEFT 方法研究,本文提出 LLM-Adapters,一个易于使用的框架,将多种适配器集成到 LLM 中,并能针对不同的任务执行这些基于适配器的 LLM PEFT 方法。该框架包含 LLaMA、BLOOM 和 GPT-J 等最先进的开放获取 LLM,以及 Series adapters、Parallel adapter、基于提示的学习和基于重参数化的方法等广泛使用的适配器。此外,我们针对每种基于适配器的方法,对适配器类型、放置位置和超参数对最佳设计的影响进行了广泛的实证研究。我们在来自算术推理和常识推理两类不同推理任务的十四个数据集上评估了适配器的有效性。结果表明,在较小规模 LLM(7B)中使用基于适配器的 PEFT 并仅训练极少额外参数,在两项推理任务的零样本推断中取得了与强大 LLM(175B)可比、且在某些情况下更优的性能。
引用
@article{arxiv.2304.01933,
title = {LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models},
author = {Zhiqiang Hu and Lei Wang and Yihuai Lan and Wanyu Xu and Ee-Peng Lim and Lidong Bing and Xing Xu and Soujanya Poria and Roy Ka-Wei Lee},
journal= {arXiv preprint arXiv:2304.01933},
year = {2023}
}
备注
EMNLP 2023. The code of our framework can be found at https://github.com/AGI-Edgerunners/LLM-Adapters. We will keep all of the code open-source and continue to update the framework with new adapters, LLMs, and tasks