中文

面向大语言模型微调的离群值加权分层采样

机器学习 2025-06-10 v3 人工智能 计算与语言

摘要

大语言模型(LLM)的快速发展彻底改变了各种自然语言处理任务。然而,LLM的巨大规模给训练或微调带来了重大挑战。虽然低秩适配(LoRA)等参数高效方法已广受欢迎,但与全秩微调相比,它们通常会牺牲性能。在本文中,我们提出离群值加权分层采样(OWS),一种受LLM逐层离群值分布启发的新型内存高效微调方法。与为所有层添加额外适配器的LoRA不同,OWS策略性地为离群值较多的层分配更高的采样概率,仅选择性地采样少数层并微调其预训练权重。为了在不按比例增加内存成本的情况下进一步增加微调层数,我们引入了梯度低秩投影,从而进一步提升了该方法的性能。我们在包括LLaMa2和Mistral在内的各种架构上进行的大量实验表明,OWS始终优于包括全微调在内的基线方法。具体来说,它在常识推理基准上平均准确率提升高达1.1%,在MMLU上提升3.0%,在MT-Bench上显著提升10%,同时内存效率更高。OWS使我们能够仅用21GB内存微调7B LLM。我们的代码可在https://github.com/pixeli99/OWS获取。

关键词

引用

@article{arxiv.2405.18380,
  title  = {Outlier-weighed Layerwise Sampling for LLM Fine-tuning},
  author = {Pengxiang Li and Lu Yin and Xiaowei Gao and Shiwei Liu},
  journal= {arXiv preprint arXiv:2405.18380},
  year   = {2025}
}