中文

超越规模:衡量与预测语言模型预训练中知识保留的上限

计算与语言 2026-01-08 v7 人工智能

摘要

GPT-4技术报告表明下游性能可从预训练信号预测,但对如何量化此过程方法论细节贡献不足。本工作通过建模知识保留(预训练语言模型记忆其语料库中事实信息的能力)并引入原则性方法在训练前估计其容量。我们提出大小依赖互信息(SMI),这是一种信息论预测器,整合知识频率、知识特异性和模型规模,以预测闭包问答(QA)准确率。SMI通过对21个公开及3个自定义模型的公开预训练语料库进行大规模文档检索,结合稳健的多模板QA评估进行验证。实验表明,SMI显著优于基于重复的基线方法,在参数超过10亿的模型中实现R² > 0.7的QA准确率预测,无需额外训练。进一步分析揭示了数据规模和模型规模的报酬递减,并为预训练alone无法实现的知识保留内在上限提供证据,动机了检索及其他增强策略。数据集与代码已公开于https://github.com/yuhui1038/SMI。

关键词

引用

@article{arxiv.2502.04066,
  title  = {Beyond Scaling: Measuring and Predicting the Upper Bound of Knowledge Retention in Language Model Pre-Training},
  author = {Changhao Jiang and Ming Zhang and Yifei Cao and Junjie Ye and Xiaoran Fan and Shihan Dou and Zhiheng Xi and Jiajun Sun and Yi Dong and Yujiong Shen and Jingqi Tong and Baoyu Fan and Tao Gui and Qi Zhang and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2502.04066},
  year   = {2026}
}