大型语言模型在预训练期间如何获取事实知识?
计算与语言
2024-11-13 v3
摘要
尽管近期观察到大型语言模型(LLMs)能够存储大量事实知识,但我们对其通过预训练获取事实知识的机制了解仍有限。本工作通过研究 LLMs 在预训练期间获取事实知识的方式来填补这一空白。研究发现,关于预训练期间事实知识获取的动态有几个重要启示。首先,令人反意识的是,我们观察到对更多数据进行预训练对模型获取和维持事实知识的能力没有显著改善。其次,在训练步骤与事实知识记忆和泛化遗忘之间存在幂律关系,以及在重复训练数据上训练的 LLMs exhibits 更快的遗忘。第三,使用更大的批量大小可以增强模型对遗忘的鲁棒性。总体而言,我们的观察表明,LLM 预训练中的事实知识获取是通过在每一步中增加预训练数据中呈现事实知识概率来实现的。然而,这种增加被随后的遗忘所稀释。基于此解释,我们为最近观察到的 LLM 行为提供了合理的解释,例如 LLMs 在长尾知识方面表现较差以及去除预训练语料库副本的好处。
引用
@article{arxiv.2406.11813,
title = {How Do Large Language Models Acquire Factual Knowledge During Pretraining?},
author = {Hoyeon Chang and Jinho Park and Seonghyeon Ye and Sohee Yang and Youngkyung Seo and Du-Seong Chang and Minjoon Seo},
journal= {arXiv preprint arXiv:2406.11813},
year = {2024}
}
备注
Accepted at NeurIPS 2024