ScalingFilter: 基于反向利用标度定律评估数据质量
计算与语言
2024-08-16 v1
摘要
高质量数据对于大型语言模型的预训练性能至关重要。不幸的是,现有的质量过滤方法依赖于已知的高质量数据集作为参考,这可能引入潜在偏见并损害多样性。本文提出了 ScalingFilter,这是一种一种新方法,其基于两个在相同数据上训练的语言模型的困惑度差来评估文本质量,从而消除过滤过程中参考数据集的影响。理论分析表明,ScalingFilter 等价于对标度定律的反向利用。通过在相同数据源上使用各种质量过滤器处理后训练 13 亿参数的模型,我们发现 ScalingFilter 可以提高预训练模型在下游任务中的零样本性能。为了评估质量过滤引入的偏见,我们引入了语义多样性,这是一种利用文本嵌入模型进行语义表示的指标。大量实验表明,语义多样性是数据集多样性可靠指标,ScalingFilter 在下游性能和语义多样性之间实现了最佳平衡。
引用
@article{arxiv.2408.08310,
title = {ScalingFilter: Assessing Data Quality through Inverse Utilization of Scaling Laws},
author = {Ruihang Li and Yixuan Wei and Miaosen Zhang and Nenghai Yu and Han Hu and Houwen Peng},
journal= {arXiv preprint arXiv:2408.08310},
year = {2024}
}