Data-Juicer:面向大语言模型的一站式数据处理系统
摘要
大语言模型(LLMs)的迅猛发展凸显了海量、异构且高质量数据的重要性。数据配方是用于训练 LLM 的来自不同数据源的数据混合,对 LLM 的性能起着至关重要的作用。现有的开源 LLM 数据处理工具大多针对特定的数据配方而定制。为了持续挖掘 LLM 的潜力、纳入新来源的数据并提升 LLM 的性能,我们构建了一个名为 Data-Juicer 的新系统,借助该系统我们能够高效生成多样化的数据配方、探索形成数据混合的不同可能性,并评估它们对模型性能的影响。与传统的数据分析流水线不同,Data-Juicer 面临一些独特挑战。首先,构成数据配方的可能数据源在质量和规模上高度异构且海量。其次,精确评估数据配方对 LLM 性能的影响极其昂贵。第三,Data-Juicer 的终端用户即模型开发者,需要足够的灵活性来配置和评估不同的数据配方。Data-Juicer 具备用于构建数据配方的细粒度流水线抽象,内置超过 50 个算子以便于组合与扩展。通过集成可视化与自动评估能力,Data-Juicer 为 LLM 预训练与微调提供了及时的反馈闭环。此外,Data-Juicer 经过优化并与 LLM 训练、评估和分布式计算生态系统集成。借助 Data-Juicer 得到的数据配方在最先进的 LLM 上取得了显著提升,在 16 个 LLM 基准上的平均得分提升高达 7.45%,在成对 GPT-4 评估中胜率高出 17.5%。我们的系统、数据配方与教程已开源,呼吁开展更广泛的以数据为中心的研究来训练和理解 LLM。
引用
@article{arxiv.2309.02033,
title = {Data-Juicer: A One-Stop Data Processing System for Large Language Models},
author = {Daoyuan Chen and Yilun Huang and Zhijian Ma and Hesen Chen and Xuchen Pan and Ce Ge and Dawei Gao and Yuexiang Xie and Zhaoyang Liu and Jinyang Gao and Yaliang Li and Bolin Ding and Jingren Zhou},
journal= {arXiv preprint arXiv:2309.02033},
year = {2023}
}
备注
20 Pages, 10 figures, 9 tables. The system, data recipes, and demos are continuously maintained at https://github.com/alibaba/data-juicer