如何高效注入知识?面向大语言模型预训练的知识注入缩放定律
计算与语言
2025-09-25 v1 人工智能
摘要
大语言模型(LLM)因其在各类下游任务中表现出的强大通用能力而备受关注。然而,在没有领域特定优化的情况下,它们在专业知识基准测试中往往表现不佳,甚至会产生幻觉。近期研究表明,在预训练期间有策略地注入领域知识可以显著提升下游性能。一个关键挑战在于平衡这种注入的权衡:注入过少的领域特定数据会导致专业化不足,而过度注入则会引发对先前所学知识的灾难性遗忘。在这项工作中,我们聚焦于由过度注入引发的记忆崩溃现象。通过系统性实验,我们得出两个关键观察结果:1) 临界崩溃点:每个模型都存在一个阈值,超过该阈值其知识保持能力会急剧下降。2) 规模相关性:这些崩溃点与模型的规模呈一致的缩放关系。基于这些见解,我们提出了一条知识注入缩放定律,通过分析较小规模的同类模型,来预测向大型 LLM 注入领域知识的最佳量。在不同模型规模和预训练 token 预算上的大量实验,验证了我们缩放定律的有效性和泛化性。
引用
@article{arxiv.2509.19371,
title = {How to inject knowledge efficiently? Knowledge Infusion Scaling Law for Pre-training Large Language Models},
author = {Kangtao Lv and Haibin Chen and Yujin Yuan and Langming Liu and Shilei Liu and Yongwei Wang and Wenbo Su and Bo Zheng},
journal= {arXiv preprint arXiv:2509.19371},
year = {2025}
}