Perplexity 感知的数据扩展定律:Perplexity 景观预测持续预训练中的性能
机器学习
2025-12-29 v1 计算与语言
摘要
持续预训练(CPT)是适应基础模型以应用于特定领域的基本方法。预训练的扩展定律定义了数据集大小与大型语言模型(LLM)测试损失之间的幂律关系。然而,仅通过增加数据量进行 CPT 的边际收益会迅速下降,导致数据利用不足和训练效率低下。为此,我们提出一种新的 perplexity 感知的数据扩展定律,以建立 domain-specific 数据的 perplexity 景观与测试损失之间的预测关系。我们的ethods 利用预训练模型在 domain 数据上的 perplexity 作为估计知识鸿沟的代理指标,有效量化了候选训练样本的信息 perplexity 景观。通过在 diverse perplexity 区间内拟合此扩展定律,我们 enables 自适应选择高效数据子集,优先考虑最大化知识吸收同时最小化冗余和噪声的内容。广泛的实验表明,我们的方法始终能够识别接近最优的训练子集,并在 medical 和 general-domain benchmark 上实现优异性能。
关键词
引用
@article{arxiv.2512.21515,
title = {Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training},
author = {Lei Liu and Hao Zhu and Yue Shen and Zhixuan Chu and Jian Wang and Jinjie Gu and Kui Ren},
journal= {arXiv preprint arXiv:2512.21515},
year = {2025}
}