中文

近似正则化重放对大型语言模型高效监督微调的有效性

机器学习 2025-12-30 v1 人工智能

摘要

尽管参数高效微调方法(如LoRA)仅修改一小部分参数,但它们可能对模型产生显著影响。我们的指令微调实验表明,基于LoRA的监督微调可能会灾难性地降低模型能力,即使在非常小的数据集上训练相对较少的步骤也是如此。尽管如此,我们证明,虽然最直接的方法(可能是在实践中使用最多的方法)会严重失败,但对训练过程进行开销很小的微小调整几乎可以消除该问题。特别地,在本文中,我们考虑一种正则化的近似重放方法,该方法惩罚相对于初始模型的KL散度,并交错插入来自一个与预训练所用语料不同但相似的开源语料的下一个词预测数据。当应用于Qwen指令微调模型时,我们发现这种方法在不妨碍新任务可塑性的情况下保留了模型中的通用知识,同时仅增加了适度的计算开销。

关键词

引用

@article{arxiv.2512.22337,
  title  = {The Effectiveness of Approximate Regularized Replay for Efficient Supervised Fine-Tuning of Large Language Models},
  author = {Matthew Riemer and Erik Miehling and Miao Liu and Djallel Bouneffouf and Murray Campbell},
  journal= {arXiv preprint arXiv:2512.22337},
  year   = {2025}
}