中文

大语言模型(LLM)在低资源环境下不同高效微调方法的比较分析

计算与语言 2024-05-24 v1 机器学习

摘要

在大语言模型(LLM)领域,arXiv:2305.16938 表明,few-shot 全模型微调——即 Vanilla 微调(FT)和基于模式的微调(PBFT)——以及基于情境学习(ICL)在 out-of-domain(OOD)数据集上泛化类似,但在任务适应方面存在差异。然而,它们都面临挑战,尤其是内存要求方面。在本文中,我们进一步尝试推进对 LLM 不同微调策略的理解,并旨在将这些方法在两种多样化数据集上与全模型微调进行详尽比较。为此,我们在两个数据集上对预训练模型进行一系列实验,首先从最先进的方法——vanilla 微调和基于模式的微调(PBFT)开始。随后,我们探讨了自适应微调和 LoRA 适配器在 few-shot 设置下的效率。最后,我们还将最近流行的情境蒸馏方法与 vanilla 微调和 PBFT 进行比较,分别在有和没有 few-shot 设置下进行。我们的发现表明,这些替代策略在 out-of-domain 泛化方面可与 vanilla 微调和 PBFT 相当。PBFT 在 out-of-domain(OOD)数据上表现不如 Vanilla 微调,强调了有效提示词的重要性。进一步地,我们的自适应微调和 LoRA 实验的表现与标准微调相当或略差于标准微调,因为标准微调涉及整个模型的调参。最后,我们的情境蒸馏实验超越了标准微调方法。这一发现表明,最终选择合适的微调方法取决于可用资源(内存、计算、数据)和任务适应性。

关键词

引用

@article{arxiv.2405.13181,
  title  = {Comparative Analysis of Different Efficient Fine Tuning Methods of Large Language Models (LLMs) in Low-Resource Setting},
  author = {Krishna Prasad Varadarajan Srinivasan and Prasanth Gumpena and Madhusudhana Yattapu and Vishal H. Brahmbhatt},
  journal= {arXiv preprint arXiv:2405.13181},
  year   = {2024}
}

备注

9 pages of main paper, 1 page of references, 6 appendix pages, 11 figures, 18 tables