中文

阿姆罗与查尔:分析大语言模型预训练与微调之间的关系

计算与语言 2025-03-19 v5 人工智能

摘要

大型语言模型的发展催生了预训练-微调范式,其中模型通常在大型文本语料库上进行预训练,并经过调优阶段以与人类偏好或下游任务对齐。在本工作中,我们通过对多个中间预训练模型检查点进行微调,探讨了预训练与微调之间的关系。我们在 18 个数据集上的结果表明:i)持续预训练以隐式方式提升模型性能,这种提升在微调后才会显现;ii)对于模型在预训练阶段未展现能力的数据集,额外微调带来的收益远超模型在预训练阶段已表现良好的数据集;iii)尽管监督式微调显著提升模型性能,但可能导致模型遗忘先前已知的领域知识和在微调期间未出现的任务;iv)模型在监督式微调后对评估提示词高度敏感,但通过更多预训练可缓解这种敏感性。

关键词

引用

@article{arxiv.2408.06663,
  title  = {Amuro and Char: Analyzing the Relationship between Pre-Training and Fine-Tuning of Large Language Models},
  author = {Kaiser Sun and Mark Dredze},
  journal= {arXiv preprint arXiv:2408.06663},
  year   = {2025}
}

备注

Rep4NLP Camera Ready