中文

少量数据即可装填更多:训练数据剪枝提升事实记忆

计算与语言 2026-04-10 v1 机器学习

摘要

大型语言模型(LLMs)在记忆其参数中的事实知识时常常遇到困难,常导致幻觉并在知识密集型任务上表现不佳。在本文中,我们从信息论角度正式化事实记忆,并研究训练数据分布如何影响事实准确性。我们表明,仅当训练数据中的事实信息量超过模型容量时,事实准确性才次于容量限制。这一现象在事实频率分布呈倾斜(例如幂律分布)时进一步恶化。我们提出了基于训练损失的数据选择方案,旨在限制训练数据中的事实数量并平滑其频率分布。在包含高熵事实的半合成数据集上,我们的方法有效提升了事实准确性至容量限制。当在标注的维基百科语料库上从头预训练语言模型时,我们的方法使GPT2-Small模型(1.1亿参数)记忆的实体事实数量提高1.3倍,匹配在完整数据集上预训练的10倍规模模型(13亿参数)的性能。

关键词

引用

@article{arxiv.2604.08519,
  title  = {Cram Less to Fit More: Training Data Pruning Improves Memorization of Facts},
  author = {Jiayuan Ye and Vitaly Feldman and Kunal Talwar},
  journal= {arXiv preprint arXiv:2604.08519},
  year   = {2026}
}