中文

利用 CGC-LoRA 算法在大语言模型中实现 1+N 多任务微调模式的框架

计算与语言 2024-02-06 v1 人工智能 机器学习

摘要

随着大语言模型 (LLMs) 在自然语言处理 (NLP) 领域的富有成效的演进,人们已投入大量精力有效地微调常见的预训练 LLMs,以在一个或多个特定领域完成各种任务。在实践中,实现适配主要有两种流行方式:(i) 多个独立模型:使用每个任务对应的训练样本独立多次微调预训练 LLMs。(ii) 集成模型:利用所有任务的样本统一微调一个预训练 LLM。为了同时解决高计算成本和跷跷板效应问题,我们提出了一种统一框架,利用一种新颖的定制门控控制 (Customized Gate Control, CGC) 低秩适应 (LoRA) 算法,在 LLMs 中实现 1+N 多任务微调模式。我们的工作旨在结合多任务学习 (MTL,即 CGC) 和参数高效微调 (PEFT,即 LoRA) 方案的优势。对于给定的任务簇,我们设计了一个包含两类专家作为额外可训练参数的创新层,使 LoRA 与 MTL 兼容。为了全面评估所提出的框架,我们在两个公共数据集上进行了精心设计的实验。实验结果表明,带有 CGC-LoRA 模块的统一框架在两个数据集上的评估得分均高于所有基准模型。

关键词

引用

@article{arxiv.2402.01684,
  title  = {A Framework to Implement 1+N Multi-task Fine-tuning Pattern in LLMs Using the CGC-LORA Algorithm},
  author = {Chao Song and Zhihao Ye and Qiqiang Lin and Qiuying Peng and Jun Wang},
  journal= {arXiv preprint arXiv:2402.01684},
  year   = {2024}
}