MATES:基于数据影响力模型的高效预训练模型感知数据选择
计算与语言
2024-11-19 v2 机器学习
摘要
预训练数据选择通过从海量网络数据语料中利用更高质量的数据,有望提升语言模型的预训练效率。当前的数据选择方法依赖于手工规则或更大的参考模型,它们以静态方式执行,无法捕捉预训练过程中不断变化的数据偏好。在本文中,我们引入了基于数据影响力模型(MATES)的模型感知数据选择方法,其中数据影响力模型持续适应预训练模型不断变化的数据偏好,然后选择对当前预训练进度最有效的数据。具体来说,我们通过局部探测预训练模型来收集真实数据影响力,并微调一个小型数据影响力模型以准确逼近该影响力。然后,数据影响力模型预测整个预训练语料库上的数据影响力,并为下一预训练阶段选择最具影响力的数据。在C4数据集上预训练410M和1B模型的实验表明,MATES在广泛的下游任务上显著优于随机数据选择。它使利用更大参考模型的最先进数据选择方法所取得的增益翻倍,并将达到特定性能所需的总FLOPs减少一半。进一步的分析验证了局部探测的真实数据影响力以及使用数据影响力模型进行逼近的有效性。我们的代码已在https://github.com/cxcscmu/MATES开源。
引用
@article{arxiv.2406.06046,
title = {MATES: Model-Aware Data Selection for Efficient Pretraining with Data Influence Models},
author = {Zichun Yu and Spandan Das and Chenyan Xiong},
journal= {arXiv preprint arXiv:2406.06046},
year = {2024}
}
备注
Accepted to NeurIPS 2024