预测批量调度:通过基于损失感知的样本优先级加速语言模型训练
人工智能
2026-02-20 v1
摘要
我们提出Predictive Batch Scheduling(PBS),一种新颖的训练优化技术,通过动态优先级排序高损失样本来加速语言模型收敛。不同于需要预定义难度度量的课程学习方法,或需要昂贵逐样本损失跟踪的硬示例挖掘方法,PBS采用轻量级线性预测器在线训练,以从静态token级特征估计样本难度。我们的预测器仅使用四个简单特征(token频率、序列长度、词汇多样性和罕见token比率)即可实现0.44的实际损失相关性。在1.3亿参数的transformer上实验表明,PBS通过评估损失衡量的收敛速度提高了6-13%,且在10,000个训练步骤中,预测器的相关性从0.14提升至0.44。这些结果验证了token频率统计编码了关于样本难度的有意义信息,使基于几乎零计算开销的课程学习成为可能。
引用
@article{arxiv.2602.17066,
title = {Predictive Batch Scheduling: Accelerating Language Model Training Through Loss-Aware Sample Prioritization},
author = {Sumedh Rasal},
journal= {arXiv preprint arXiv:2602.17066},
year = {2026}
}