偏好课程: LLM 应始终在其偏好数据上进行预训练
计算与语言
2025-02-18 v2 人工智能
摘要
大型语言模型 (LLM) 通常在预训练过程中利用一致的数据分布。然而,随着模型能力的提升,数据偏好会动态变化,这表明需要在不同训练阶段使用不同的数据进行预训练。为实现这一点,我们提出了基于困惑差 (Perplexity Difference, PD) 的偏好课程学习 (PDPC) 框架,该框架始终感知并利用 LLM 偏好的数据进行训练和提升。首先,我们引入 PD 指标来量化弱模型与强模型对样本难度的差异。PD 较高的样本对弱模型而言更具挑战性,适合安排在预训练的后期阶段。其次,我们提出偏好函数,以近似和预测 LLM 在任意训练步骤的数据偏好,从而完成数据集的离线安排,确保连续训练期间不中断。在 13 亿和 30 亿参数模型上的实验结果表明,PDPC 显著优于基线方法。值得注意的是,使用 1T token 训练的 30 亿参数模型在 MMLU 和 CMMLU 上的平均准确率提升了超过 8.1%。
引用
@article{arxiv.2501.13126,
title = {Preference Curriculum: LLMs Should Always Be Pretrained on Their Preferred Data},
author = {Xuemiao Zhang and Liangyu Xu and Feiyu Duan and Yongwei Zhou and Sirui Wang and Rongxiang Weng and Jingang Wang and Xunliang Cai},
journal= {arXiv preprint arXiv:2501.13126},
year = {2025}
}
备注
18 pages, 13 figures