揭示微调大语言模型的泛化能力
计算与语言
2024-03-15 v1
摘要
尽管大语言模型(LLM)展现出了卓越的多任务能力,但通常需要针对下游特定领域数据集对这些模型进行微调,才能在测试集上取得优于未微调模型的性能。然而,微调对 LLM 泛化能力的综合影响尚未被完全理解。本文深入探讨了原始未修改的 LLM 与其微调变体之间的差异。我们的主要研究重点是微调是否会影响 LLM 固有的泛化能力。为了详细说明这一点,我们在各种数据集上进行了跨越五个不同语言任务的广泛实验。我们的主要发现表明,在生成和分类任务上微调的模型在泛化到不同领域和任务时表现出不同的行为。有趣的是,我们观察到在生成任务的微调过程中引入上下文学习策略可以增强模型的泛化能力。通过这项系统性研究,我们旨在为 LLM 微调实践的演进提供有价值的见解。
引用
@article{arxiv.2403.09162,
title = {Unveiling the Generalization Power of Fine-Tuned Large Language Models},
author = {Haoran Yang and Yumeng Zhang and Jiaqi Xu and Hongyuan Lu and Pheng Ann Heng and Wai Lam},
journal= {arXiv preprint arXiv:2403.09162},
year = {2024}
}
备注
NAACL 2024