中文

DataFlow: LLM 驱动的统一数据准备与工作流自动化框架,适用于数据中心 AI 时代

机器学习 2025-12-19 v1 计算与语言

摘要

大语言模型对高质量数据日益增长的需求加剧了对可扩展、可靠且语义丰富的数据准备流水线的需求。然而当前实践仍以临时脚本和松散指定的工作流为主导,缺乏原则性的抽象,阻碍了可复现性,且对模型在循环中的数据生成支持有限。为应对这些挑战,我们提出了 DataFlow,一个统一且可扩展的 LLM 驱动数据准备框架。DataFlow 采用了系统级抽象,使模块化、可复用和可组合的数据转换成为可能,并提供了 PyTorch 风格的流水线构建 API,用于构建可调试和可优化的数据流。该框架包含近 200 个可复用操作符和六个领域通用流水线,涵盖文本、数学推理、代码、Text-to-SQL、代理式 RAG 和大规模知识提取。为进一步提升可用性,我们引入了 DataFlow-Agent,它通过操作符合成、流水线规划和迭代验证,自动将自然语言规范转换为可执行流水线。在六个代表性用例中,DataFlow 一致提升了下游 LLM 性能。我们的数学、代码和文本流水线超越了精心策划的人工数据集和专门的合成基线,在 Text-to-SQL 上实现了高达 +3% 的执行准确率(超越 SynSQL),在代码基准上实现了平均 +7% 的提升,在 MATH、GSM8K 和 AIME 上实现了 1-3 分的提升。此外,DataFlow 生成的统一 10K 样本数据集使基础模型超越了在 1M Infinity-Instruct 数据上训练的对应模型。这些结果表明 DataFlow 为可靠、可复现和可扩展的 LLM 数据准备提供了实用且高性能的基础设施,并为未来的数据中心 AI 发展建立了系统级基础。

关键词

引用

@article{arxiv.2512.16676,
  title  = {DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI},
  author = {Hao Liang and Xiaochen Ma and Zhou Liu and Zhen Hao Wong and Zhengyang Zhao and Zimo Meng and Runming He and Chengyu Shen and Qifeng Cai and Zhaoyang Han and Meiyi Qiang and Yalin Feng and Tianyi Bai and Zewei Pan and Ziyi Guo and Yizhen Jiang and Jingwen Deng and Qijie You and Peichao Lai and Tianyu Guo and Chi Hsu Tsai and Hengyi Feng and Rui Hu and Wenkai Yu and Junbo Niu and Bohan Zeng and Ruichuan An and Lu Ma and Jihao Huang and Yaowei Zheng and Conghui He and Linpeng Tang and Bin Cui and Weinan E and Wentao Zhang},
  journal= {arXiv preprint arXiv:2512.16676},
  year   = {2025}
}