中文

大语言模型微调中的迁移学习

计算与语言 2024-11-05 v1 机器学习

摘要

随着大语言模型格局的扩展,针对特定任务进行高效微调变得越来越重要。与此同时,参数高效微调方法的前景迅速扩展。因此,从业者在为大型语言模型搜索最优微调流程时面临众多复杂选择。为了降低从业者的复杂性,我们研究了大语言模型微调中的迁移学习,旨在将来自相关微调任务的知识转移到新任务上。在本工作中,我们通过元学习从新的元数据集中学习微调的性能和成本代理模型,进行迁移学习。反直觉的是,我们提出仅依赖迁移学习来处理新数据集。因此,我们不使用任务特定的贝叶斯优化,而是优先使用来自相关任务的知识而非任务特定的反馈。我们在八个合成问答数据集和一个由 1,800 次 Microsoft Phi-3 微调运行组成的元数据集上评估了我们的方法。我们的迁移学习优于零样本、默认微调和元优化基线。我们的结果证明了微调的可迁移性,能够更有效地适配大语言模型。

关键词

引用

@article{arxiv.2411.01195,
  title  = {Transfer Learning for Finetuning Large Language Models},
  author = {Tobias Strangmann and Lennart Purucker and Jörg K. H. Franke and Ivo Rapant and Fabio Ferreira and Frank Hutter},
  journal= {arXiv preprint arXiv:2411.01195},
  year   = {2024}
}

备注

Accepted at NeurIPS 2024 Workshop on Adaptive Foundation Models