中文

用于语言模型预训练的不可约课程

计算与语言 2023-10-25 v1 人工智能 机器学习

摘要

为训练大语言模型进行自动数据选择与课程设计具有挑战性,仅有少数现有方法显示出相对于标准训练的改进。此外,当前方案聚焦于领域级选择,忽视了每个独立训练点更细粒度的贡献。在传统数据点选择方法应用于大语言模型时存在困难:多数在线批次选择方法需进行两次前向或反向传播,这在大规模模型上引入了可观的额外开销。为缓解这些障碍,我们提出不可约课程作为一种用于语言模型预训练的课程学习算法,其优先处理具有更高可学习性的样本。具体而言,为避免 prohibitive 的额外计算开销,我们使用小规模代理模型沿主模型训练轨迹模拟样本损失。我们在 RedPajama-1B 数据集上的实验展示了相较于随机均匀基线与反课程策略,在所有 7 个领域上验证困惑度的一致提升。我们的方法也降低了网络的锐度,并展现出在 MMLU 基准上更好的 5-shot 准确率。

关键词

引用

@article{arxiv.2310.15389,
  title  = {Irreducible Curriculum for Language Model Pretraining},
  author = {Simin Fan and Martin Jaggi},
  journal= {arXiv preprint arXiv:2310.15389},
  year   = {2023}
}