面向 AGI 的数据科学与技术 第一部分:分层数据管理
人工智能
2026-02-10 v1 计算与语言
摘要
人工智能的发展可视为数据驱动学习范式演变的过程,持续的范式转变不断推动模型能力的提升。当前的 LLM 研究主要依赖数据规模的单向扩展,日益遇到的瓶颈包括数据可用性、获取成本和训练效率。本文我们认为,AGI 的发展正进入数据-模型共演进的新阶段,在此阶段模型主动指导数据管理,而高质量数据反过来又放大模型能力。为实现此愿景,我们提出了分层数据管理框架,旨在支持异构学习目标和成本约束下的完整 LLM 训练生命周期。具体而言,我们引入 L0-L4 分层数据管理框架,从原始未加工资源到组织化且可验证的知识不等。重要的是,LLM 完全用于数据管理过程中,如质量评分和内容编辑,以跨层次 refined 数据。每个层次都具有 distinct 数据属性、管理策略和训练角色,使数据能够战略性地分配给 LLM 训练阶段,包括 pre-training、mid-training 和 alignment。该框架平衡数据质量、获取成本和边际训练收益,提供一种可扩展且可持续的数据管理系统方法。我们通过实证研究验证了所提框架的有效性,其中从原始语料库构建分层数据集并用于多个训练阶段。实验结果表明,层级感知的数据利用显著提高了训练效率和模型性能。为便于进一步研究,我们将分层数据集和处理工具发布给社区。
引用
@article{arxiv.2602.09003,
title = {Data Science and Technology Towards AGI Part I: Tiered Data Management},
author = {Yudong Wang and Zixuan Fu and Hengyu Zhao and Chen Zhao and Chuyue Zhou and Xinle Lin and Hongya Lyu and Shuaikang Xue and Yi Yi and Yingjiao Wang and Zhi Zheng and Yuzhou Zhang and Jie Zhou and Chaojun Xiao and Xu Han and Zhiyuan Liu and Maosong Sun},
journal= {arXiv preprint arXiv:2602.09003},
year = {2026}
}
备注
16 pages, 3 figures, 7 tables