中文

Modyn:以数据为中心的机器学习流水线编排

机器学习 2025-01-27 v3 人工智能 数据库 分布式、并行与集群计算 机器学习

摘要

在现实世界的机器学习(ML)流水线中,数据集持续增长。模型必须纳入这些新的训练数据,以提高泛化能力并适应潜在的分布偏移。模型再训练的成本与再训练的频率和训练所用的数据量成正比,这使得每次从头开始训练的朴素方法不切实际。我们提出了 Modyn,一个以数据为中心的端到端机器学习平台。Modyn 的 ML 流水线抽象使用户能够声明式地描述在持续增长的数据集上训练模型的策略。Modyn 流水线允许用户应用数据选择策略(以减少数据点数量)和触发策略(以减少训练次数)。Modyn 执行并编排这些持续的 ML 训练流水线。该系统是开源的,并附带一个包含基准数据集、模型和工具的生态系统。我们通过引入复合模型的概念,正式讨论了如何衡量 ML 流水线的性能,从而能够公平比较具有不同数据选择和触发策略的流水线。我们实证分析了各种数据选择和触发策略如何影响模型准确率,并展示了 Modyn 能够通过样本级数据选择实现高吞吐量训练。

关键词

引用

@article{arxiv.2312.06254,
  title  = {Modyn: Data-Centric Machine Learning Pipeline Orchestration},
  author = {Maximilian Böther and Ties Robroek and Viktor Gsteiger and Robin Holzinger and Xianzhe Ma and Pınar Tözün and Ana Klimovic},
  journal= {arXiv preprint arXiv:2312.06254},
  year   = {2025}
}

备注

final version published at SIGMOD'25; 30 pages