大型语言模型事实记忆的规模律
计算与语言
2024-06-25 v1
摘要
事实知识记忆是大型语言模型(LLM)生成事实且可靠响应的关键因素。然而,LLM的事实记忆行为仍未得到充分探索。本文分析了LLM事实知识及不同类型事实记忆的规模律。我们发现,LLM的事实知识容量与模型规模和训练历元数之间呈线性关系和负指数律关系。通过构建的规模律估算,记忆整个维基数据(Wikidata)的事实需要训练1000B非嵌入参数的LLM进行100个历元的训练,这表明在通用预训练设置下,使用LLM记忆所有公共事实几乎是不可行的。同时,我们发现LLM能够对未见过的事实知识进行泛化,其规模律类似于常规预训练。此外,我们分析了LLM事实记忆的兼容性和偏好。就兼容性而言,我们发现LLM在统一方式记忆冗余事实时存在困难。只有当相关事实具有相同的方向和结构时,LLM才能兼容地记忆它们。这表明LLM对冗余事实记忆的效率较低。就偏好而言,LLM更关注记忆更频繁且更困难的事实,后续的事实会覆盖先前事实的记忆,这显著阻碍了低频事实的记忆。我们的发现揭示了LLM事实知识学习的容量和特征,为LLM的事实知识增强提供了方向。
引用
@article{arxiv.2406.15720,
title = {Scaling Laws for Fact Memorization of Large Language Models},
author = {Xingyu Lu and Xiaonan Li and Qinyuan Cheng and Kai Ding and Xuanjing Huang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2406.15720},
year = {2024}
}