文本数据质量过滤的实证探索
计算与语言
2021-10-08 v2
摘要
尽管传统观点认为,更激进地从Common Crawl等低质量来源过滤数据总能单调提升训练数据质量,但我们发现,激进过滤实际上会导致类GPT语言模型在广泛下游任务上的模型质量下降。我们推测,这是因为对代理指标进行足够强的优化会损害真实目标上的性能,这表明在试图更激进地过滤时,需要更鲁棒的过滤目标。我们希望本工作能促使未来研究详细分析数据集过滤设计选择对下游模型性能的影响。
引用
@article{arxiv.2109.00698,
title = {An Empirical Exploration in Quality Filtering of Text Data},
author = {Leo Gao},
journal= {arXiv preprint arXiv:2109.00698},
year = {2021}
}
备注
corrected typo in citation