生成式数据精炼: just ask for better data
机器学习
2025-09-12 v2 计算与语言
摘要
对于固定参数规模的模型,其能力主要取决于训练数据的质量和数量。因此,训练数据集的增长速度已超过网络上新数据索引速度,预计在未来十年内将面临数据耗尽。大量用户生成内容虽未被公开索引,但纳入此类数据会带来诸多风险,如泄露私人信息和其他不良内容。我们引入了一个框架——生成式数据精炼(GDR),用于利用预训练生成模型将包含不良内容的数据集转换为更适合训练的精炼数据集。我们的实验表明,GDR可以超越行业级数据匿名化解决方案,甚至能够直接实现高度不安全数据集的去有害化。此外,我们展示,通过对真实数据集中每个示例进行条件化生成合成数据,GDR的精炼输出自然匹配网络规模数据集的多样性,从而避免了通常具有挑战性的通过模型提示生成多样化合成数据的任务。GDR的简单性和有效性使其成为扩充前沿模型总体训练数据储备的强大工具。
引用
@article{arxiv.2509.08653,
title = {Generative Data Refinement: Just Ask for Better Data},
author = {Minqi Jiang and João G. M. Araújo and Will Ellsworth and Sian Gooding and Edward Grefenstette},
journal= {arXiv preprint arXiv:2509.08653},
year = {2025}
}