MixtureVitae:基于许可优先文本源构建的包含高质量指令与推理数据的开放网络规模预训练数据集
摘要
我们提出了 MixtureVitae,这是一个在提供强大下游性能的同时旨在将法律风险降至最低的开放获取预训练语料库。MixtureVitae 遵循许可优先、风险缓解的获取策略,将公共领域和许可授权的文本(例如 CC-BY/Apache)与经过审慎论证的低风险补充来源(例如政府作品和符合欧盟 TDM 资格的来源)相结合。MixtureVitae 采用简单的单阶段预训练方案,整合了大比例的许可合成指令与推理数据——这些信号通常在训练后阶段引入,而在许可网络语料库中通常很稀缺。我们将所有来源划分为反映不同风险等级的三级方案,并提供分片级别的来源元数据以实现风险感知使用。在使用 open-sci-ref 训练协议(固定架构和超参数;在 130M-1.7B 参数范围内使用 50B 和 300B token 预算)的对照实验中,在 MixtureVitae 上训练的模型在一系列标准基准上持续优于其他许可数据集,并且在 1.7B 参数/300B token 设置下,它们在训练后期超越了 FineWeb-Edu 并逼近 DCLM。在 MMLU 以及数学和代码基准上的表现尤为出色:在 300B MixtureVitae token 上预训练的 1.7B 模型在 GSM8K、HumanEval 和 MBPP 上匹配或超越了强大的 1.7B 指令微调基线,尽管其使用的 token 数量减少了 36 倍以上(300B 对比约 11T)。在详尽的去污染分析支持下,这些结果表明,具有高指令和推理密度、按许可和来源相关风险分级的许可优先数据,可以为训练有能力的 LLM 提供实用且风险缓解的基础,在不牺牲竞争力的前提下减少对广泛网络抓取的依赖。代码:https://github.com/ontocord/mixturevitae
引用
@article{arxiv.2509.25531,
title = {MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources},
author = {Huu Nguyen and Victor May and Harsh Raj and Marianna Nezhurina and Yishan Wang and Yanqi Luo and Minh Chien Vu and Taishi Nakamura and Ken Tsui and Van Khue Nguyen and David Salinas and Aleksandra Krasnodębska and Christoph Schuhmann and Mats Leon Richter and Xuan-Son and Vu and Jenia Jitsev},
journal= {arXiv preprint arXiv:2509.25531},
year = {2026}
}
备注
Code: \url{https://github.com/ontocord/mixturevitae}