daVinci-LLM:预训练的科学
人工智能
2026-03-31 v1 计算与语言
摘要
基础预训练阶段决定了模型的能力上限,因为后续训练难以超越预训练时确立的能力基础,但这一领域仍受到严重忽视。这源于一个结构悖论:拥有计算资源的组织面临商业压力,抑制了透明披露;而学术机构拥有研究自由,却缺乏预训练规模的计算资源。daVinci-LLM 处于这个未被探索的交叉区域,结合了工业规模的资源与完全的研究自由,推动了预训练科学的进步。我们采用完全开放的范式,将开放性视为科学方法,发布完整的数据处理管道、完整的训练过程以及系统性探索结果。鉴于该领域缺乏系统性的方法论,我们采用数据达尔文主义框架,这是一种从过滤到合成的原则性 L0-L9 分类法。我们在 8T 标记上从随机初始化训练一个 3B 参数模型,采用两阶段自适应课程,从基础能力逐步转向推理深度强化。在进行 200 多次受控消除实验后,我们确立了:处理深度系统性地增强了能力,将其确立为与规模扩张并列的关键维度;不同领域 exhibit 不同的饱和动力学, necessitating 采用自比例调整到格式转换的自适应策略;组成平衡实现了有针对性的强化,同时防止性能崩溃;评估协议选择如何塑造我们对预训练进展的理解。通过发布完整的探索过程,我们使社区能够建立在我们的发现之上,并形成预训练中累积性科学知识的系统方法论。
引用
@article{arxiv.2603.27164,
title = {daVinci-LLM:Towards the Science of Pretraining},
author = {Yiwei Qin and Yixiu Liu and Tiantian Mi and Muhang Xie and Zhen Huang and Weiye Si and Pengrui Lu and Siyuan Feng and Xia Wu and Liming Liu and Ye Luo and Jinlong Hou and Qipeng Guo and Yu Qiao and Pengfei Liu},
journal= {arXiv preprint arXiv:2603.27164},
year = {2026}
}