理解大语言模型预训练中数据时序性的影响
计算与语言
2026-05-26 v2 人工智能
摘要
大型语言模型(LLM)通常在混排语料上进行训练,导致模型知识在训练时间点即被冻结,其时序性 grounding 仍不清晰。在本工作中,我们研究了预训练动力学对时序相关事实知识获取的影响,具体聚焦于数据排序。我们的主要贡献有两个。首先,我们引入了一个包含7000多个时序相关问题的全面基准,以及一个评估协议,使我们能够分析模型是否正确地将事实与其对应的时间段关联起来。其次,我们在时序排序的Common Crawl快照上预训练6B参数的模型,并将其与标准混排预训练进行比较。我们的结果表明,顺序训练的模型在通用语言理解和常识知识方面与混排基线相当,同时持续展现更及时且时序精确的知识。时序排序的预训练实现了更好的事实新鲜度,而混排预训练则在较旧数据上达到峰值,可能是由于事实重复的增加。鉴于我们在 https://github.com/kyutai-labs/kairos 公开代码,在 https://huggingface.co/collections/kyutai/kairos 上发布模型检查点和数据集,这些发现为LLM的持续学习研究奠定了基础。
引用
@article{arxiv.2605.22769,
title = {Understanding Data Temporality Impact on Large Language Models Pre-training},
author = {Hippolyte Pilchen and Romain Fabre and Franck Signe Talla and Patrick Perez and Edouard Grave},
journal= {arXiv preprint arXiv:2605.22769},
year = {2026}
}