中文

MMLSpark:在海量规模上统一机器学习生态系统

机器学习 2019-06-24 v2 人工智能 分布式、并行与集群计算 机器学习

摘要

我们介绍了 Microsoft Machine Learning for Apache Spark (MMLSpark),这是一个增强型生态系统,扩展了 Apache Spark 分布式计算库,以应对深度学习、微服务编排、梯度提升、模型可解释性以及现代计算的其他领域中的问题。此外,我们提出了一种称为 Spark Serving 的新颖系统,允许用户将任何 Apache Spark 程序作为由其现有 Spark 集群支撑的分布式、亚毫秒延迟 Web 服务运行。所有 MMLSpark 贡献都具有相同的 API,以便在框架之间简单组合,并在静态、弹性或无服务器集群上的批处理、流式和 RESTful Web 服务场景中使用。我们通过创建一种能够在无需人类标注数据情况下学习的深度目标检测方法展示 MMLSpark,并证明了其在雪豹保护中的有效性。

关键词

引用

@article{arxiv.1810.08744,
  title  = {MMLSpark: Unifying Machine Learning Ecosystems at Massive Scales},
  author = {Mark Hamilton and Sudarshan Raghunathan and Ilya Matiach and Andrew Schonhoffer and Anand Raman and Eli Barzilay and Karthik Rajendran and Dalitso Banda and Casey Jisoo Hong and Manon Knoertzer and Ben Brodsky and Minsoo Thigpen and Janhavi Suresh Mahajan and Courtney Cochrane and Abhiram Eswaran and Ari Green},
  journal= {arXiv preprint arXiv:1810.08744},
  year   = {2019}
}