TiC-LM:面向时间连续性 LLM 预训练的网络规模基准测试
机器学习
2025-06-09 v3 计算与语言
摘要
在历史网络数据上训练的大型语言模型(LLM)不可避免地会变得过时。我们研究了随着新数据可用时 LLM 的评估策略和更新方法。我们引入了一个用于 LLM 时间连续性预训练的网络规模数据集,该数据集源自 114 次 Common Crawl (CC) 转储——比先前的连续语言建模基准大数个数量级。我们还设计了跨通用 CC 数据和特定领域(Wikipedia、StackExchange 和代码文档)的时间分层评估,以评估各种连续学习方法在适应新数据的同时保留过去知识的能力。我们的发现表明,在通用 CC 数据上,结合旧数据固定比例重放的自回归元调度,可以实现与从头开始训练相当的留出损失,同时所需计算量显著减少(2.6 倍)。然而,纳入新数据和重放旧数据之间的最佳平衡有所不同,因为重放对于避免在通用网络数据上发生遗忘至关重要,但在特定领域上则不然。
引用
@article{arxiv.2504.02107,
title = {TiC-LM: A Web-Scale Benchmark for Time-Continual LLM Pretraining},
author = {Jeffrey Li and Mohammadreza Armandpour and Iman Mirzadeh and Sachin Mehta and Vaishaal Shankar and Raviteja Vemulapalli and Samy Bengio and Oncel Tuzel and Mehrdad Farajtabar and Hadi Pouransari and Fartash Faghri},
journal= {arXiv preprint arXiv:2504.02107},
year = {2025}
}
备注
Code available at: https://github.com/apple/ml-tic-lm