FRAME:基于四象限多阶段预训练策略提升大语言模型
计算与语言
2025-06-03 v4
摘要
大语言模型(LLM)在人类语言理解与生成方面取得显著进展,预训练数据质量与组织方式对其性能至关重要。多阶段预训练是一条有前景的路径,但现有方法往往缺乏对数据划分的量化标准,仅依赖直觉式经验法则。本文提出一种新颖的四象限多阶段预训练策略(FRAME),依据将预训练过程组织为四个阶段以实现损失减少四次的原则而引导。该原则基于两个关键发现:其一,在高困惑度(PPL)数据上进行训练后再训练低 PPL 数据,损失会显著下降两次并带来性能提升;其二,在低困惑度差(PD)数据上进行训练后再训练高 PD 数据,同样导致损失显著下降两次并提升性能。通过将数据划分为四个象限并战略性组织,FRAME 在 3B 模型上相对于随机方法在 MMLU 和 CMMLU 上实现了 16.8% 的平均提升,显著提升了大语言模型的性能。
引用
@article{arxiv.2502.05551,
title = {FRAME: Boosting LLMs with A Four-Quadrant Multi-Stage Pretraining Strategy},
author = {Xuemiao Zhang and Feiyu Duan and Liangyu Xu and Yongwei Zhou and Sirui Wang and Rongxiang Weng and Jingang Wang and Xunliang Cai},
journal= {arXiv preprint arXiv:2502.05551},
year = {2025}
}