数据达尔文论(第二部分):DataEvolve——AI 可自主演化预训练数据策划
人工智能
2026-03-17 v1
摘要
数据达尔文论(第一部分)建立了数据处理的十级层级,表明更强的处理可解锁更大的数据价值。但该工作依赖手动设计的单一类别策略。现代预训练语料库由数百种异构类别组成,涵盖多个领域和内容类型,每种类别都需要专门处理。规模化的手动策略设计变得不可行。这引出一个关键问题:策略能否以自动方式演化?我们提出 DataEvolve,一个使策略通过迭代优化而非手动设计来演化的框架。对于每个数据类别,DataEvolve 在封闭的演化循环中运行:识别质量问题、生成候选策略、对样本数据执行策略、评估结果并跨代 refinement 方法。该过程通过经验池积累发现的问题,通过策略池跟踪各迭代的性能。应用于覆盖 6720 亿 token 的 8 个类别的 Nemotron-CC,DataEvolve 生成 Darwin-CC,一个由 30 次迭代演化而来的 5040 亿 token 数据集。在 5000 亿 token 上训练 30 亿参数模型,Darwin-CC 在原始数据上提升 3.96 分,平均衡基准 18 项中取得 44.13 分的成绩,超越 DCLM、Ultra-FineWeb 和 FineWeb-Edu,知识密集型任务如 MMLU 上取得显著提升。分析表明,演化后的策略趋向于以清洗为中心的方法:针对性噪声移除和格式规范化,带域感知的保留,呼应第一部分的 L4(生成式精炼)原则。消融研究确认迭代演化至关重要:优化后策略比次优策略提升 2.93 分,确立了在预训练规模数据策划中实现演化式策略设计的可行性与必要性。
引用
@article{arxiv.2603.14420,
title = {Data Darwinism Part II: DataEvolve -- AI can Autonomously Evolve Pretraining Data Curation},
author = {Tiantian Mi and Dongming Shan and Zhen Huang and Yiwei Qin and Muhang Xie and Yuxuan Qiao and Yixiu Liu and Chenyang Zhou and Pengfei Liu},
journal= {arXiv preprint arXiv:2603.14420},
year = {2026}
}