中文

机器学习流水线中的数据定价

机器学习 2021-08-19 v1

摘要

机器学习具有颠覆性。与此同时,机器学习要想成功,必然需要生态系统中多个参与方在自然形成的流水线式多步骤中开展协作,例如为可能的机器学习应用收集数据、多方协作训练模型以及向终端用户提供机器学习服务。数据至关重要且渗透于整个机器学习流水线之中。由于机器学习流水线涉及众多参与方,且为了成功必须形成一个建设性且动态的生态系统,市场与数据定价在连接和促进这些参与方方面具有基础性作用。在本文中,我们综述了机器学习流水线中数据定价的原理与最新研究进展。我们首先简要回顾数据市场与定价期望属性。随后,我们聚焦于机器学习流水线中三个重要步骤的定价。为理解训练数据收集步骤中的定价,我们回顾了原始数据集与数据标签的定价。我们还研究了机器学习模型协作训练步骤中的定价,并概述了机器学习部署步骤中面向终端用户的机器学习模型定价。我们也讨论了一系列可能的未来方向。

关键词

引用

@article{arxiv.2108.07915,
  title  = {Data Pricing in Machine Learning Pipelines},
  author = {Zicun Cong and Xuan Luo and Pei Jian and Feida Zhu and Yong Zhang},
  journal= {arXiv preprint arXiv:2108.07915},
  year   = {2021}
}