重放预训练数据可提升微调效果
计算与语言
2026-03-06 v1 机器学习
摘要
当前范式是对大量通用网页文本进行预训练,然后在相对有限的目标数据上进行微调。在微调期间,通常仅将通用数据混合其中,以防止忘却通用领域。我们惊讶地发现,在预训练期间重放通用数据实际上可以提高对(与之较少相关的)目标任务的性能。具体而言,在受控的预训练环境中(4M 目标 token、4B 总 token、1.5M 参数模型),通用数据重放可使微调目标数据效率提升最高可达 1.87 倍,中期训练提升可达 2.06 倍。我们进一步分析了在预训练期引入目标数据的 schedule,发现当预训练中目标数据较少时,重放效应更为显著。我们在实际中成功地演示了重放技术:对 8B 参数模型进行微调,使 agentic web navigation success 提升 4.5%,巴斯克语问答准确率提升 2%。
引用
@article{arxiv.2603.04964,
title = {Replaying pre-training data improves fine-tuning},
author = {Suhas Kotha and Percy Liang},
journal= {arXiv preprint arXiv:2603.04964},
year = {2026}
}