中文

数据达尔文主义 第1部分:解锁科学数据预训练的价值

人工智能 2026-02-10 v1 计算与语言

摘要

数据质量决定基础模型性能,但缺乏系统化的处理框架。我们提出数据达尔文主义,一个十级分类法(L0-L9),概念化数据-模型共演化:高级模型为下一代系统产生优质数据。我们在科学文献上进行验证,通过构建Darwin-Science语料库(L0-L5)。我们发现原始科学文本存在学习瓶颈,通过L4(生成性精炼)和L5(认知完成)利用前沿大语言模型阐述推理与术语。为确保严格归属, 我们从头预训练daVinci-origin-3B/7B模型,排除科学内容以创建无污染基线。经过6000亿token的继续预训练,Darwin-Science在20多个基准测试中超越基线+2.12(3B)和+2.95(7B)分数,在领域对齐任务中提升至+5.60和+8.40分。系统性推进至L5获得+1.36的总体提升,证明更高层次的处理释放了数据潜在价值。我们发布Darwin-Science语料库和daVinci-origin模型,以支持原则化的共演化开发。

关键词

引用

@article{arxiv.2602.07824,
  title  = {Data Darwinism Part I: Unlocking the Value of Scientific Data for Pre-training},
  author = {Yiwei Qin and Zhen Huang and Tiantian Mi and Weiye Si and Chenyang Zhou and Qipeng Guo and Siyuan Feng and Pengfei Liu},
  journal= {arXiv preprint arXiv:2602.07824},
  year   = {2026}
}