中文

LLM的适应之旅:为什么额外的预训练有时无法提升性能?

计算与语言 2024-10-17 v2 人工智能 机器学习

摘要

在过去十年中,深度学习模型的泛化和适应能力通常是在固定的训练和测试分布上进行评估的。与传统深度学习相反,大型语言模型(LLM)具有以下特点:(i) 更加过参数化,(ii) 在从互联网上整理、经过最少人工干预的未标记文本语料库上进行训练,以及 (iii) 以在线方式进行训练。这些显著差异阻碍了研究人员将在深度学习背景下关于模型泛化和适应的经验教训迁移到LLM。为此,我们的短文介绍了旨在阐明对已预训练语言模型进行进一步训练的经验观察。具体来说,我们证明在一个文本领域上训练模型可能会降低其在同一领域测试部分上的困惑度。通过后续分析,我们观察到性能下降与LLM的额外预训练数据集和原始预训练数据集之间的相似性呈正相关。我们进一步的词级困惑度观察表明,困惑度的下降是由于少数几个对领域信息不具信息量的词造成的。我们希望这些发现能指导我们确定何时适应模型,以及何时依赖其基础能力。

关键词

引用

@article{arxiv.2410.05581,
  title  = {Adaptation Odyssey in LLMs: Why Does Additional Pretraining Sometimes Fail to Improve?},
  author = {Fırat Öncel and Matthias Bethge and Beyza Ermis and Mirco Ravanelli and Cem Subakan and Çağatay Yıldız},
  journal= {arXiv preprint arXiv:2410.05581},
  year   = {2024}
}

备注

Accepted to EMNLP 2024 Main Conference