SkyLadder:通过上下文窗口调度实现更好更快的预训练
计算与语言
2025-12-03 v2
摘要
近期的大语言模型预训练研究不断扩展上下文窗口以处理更长的序列。然而,我们的初步研究发现,使用较短上下文窗口进行预训练的模型在固定 token 预算下, consistently优于其长上下文对手。这一发现促使我们探索最优的上下文窗口调度策略,以更好地平衡长上下文能力与预训练效率。为此,我们提出了SkyLadder,一种简单而有效的方法,实现从短到长的上下文窗口过渡。SkyLadder保持强大的标准基准性能,同时在长上下文任务中实现相同或更好的基线结果。通过大量实验,我们在1000亿token上预训练了10亿参数模型(最长32K上下文)和30亿参数模型(8K上下文),表明SkyLadder在常见基准测试中可实现最高3.7%的一致性提升,训练速度较基线最高可提高22%。代码地址:https://github.com/sail-sg/SkyLadder。
引用
@article{arxiv.2503.15450,
title = {SkyLadder: Better and Faster Pretraining via Context Window Scheduling},
author = {Tongyao Zhu and Qian Liu and Haonan Wang and Shiqi Chen and Xiangming Gu and Tianyu Pang and Min-Yen Kan},
journal= {arXiv preprint arXiv:2503.15450},
year = {2025}
}
备注
Accepted to NeurIPS 2025. 10 pages