中文

机器学习集市:利用 ML 生态系统实现高效的系统开发

软件工程 2020-11-23 v4 机器学习 机器学习

摘要

随着机器学习应用日益广泛,数据科学家常常难以为特定任务找到或创建端到端机器学习系统。各类库与框架的激增以及任务的复杂性导致了“管道丛林”——脆弱、临时的 ML 系统——的出现。为解决这些问题,我们引入了机器学习集市(Machine Learning Bazaar),一种用于开发机器学习和自动化机器学习软件系统的新框架。首先,我们引入 ML 原语(ML primitives),一种来自不同软件库的数据处理和 ML 组件的统一 API 与规范。接下来,我们将原语组合为可用的 ML 管道,抽象掉胶水代码、数据流和数据存储。我们进一步将这些管道与分层 AutoML 策略——贝叶斯优化和赌博机学习(bandit learning)——配对。我们利用这些组件创建了一个通用、多任务、端到端的 AutoML 系统,为多种数据模态(图像、文本、图、表格、关系等)和问题类型(分类、回归、异常检测、图匹配等)提供解决方案。我们展示了 5 个真实世界用例和 2 个案例研究。最后,我们提出了一个由 456 个真实世界 ML 任务组成的评估套件,并描述了在该任务套件上搜索的 250 万条管道的特征。

关键词

引用

@article{arxiv.1905.08942,
  title  = {The Machine Learning Bazaar: Harnessing the ML Ecosystem for Effective System Development},
  author = {Micah J. Smith and Carles Sala and James Max Kanter and Kalyan Veeramachaneni},
  journal= {arXiv preprint arXiv:1905.08942},
  year   = {2020}
}

备注

To appear in SIGMOD '20