管理机器学习流水线:特征存储与即将到来的嵌入生态系统浪潮
机器学习
2021-08-12 v1 数据库
摘要
工业级机器学习流水线需要大规模迭代模型特征、训练和部署模型,并监控已部署模型。特征存储被开发用于管理和标准化工程师在这一端到端流水线中的工作流,侧重于传统的表格特征数据。然而近年来,模型开发已转向使用自监督预训练嵌入作为模型特征。管理这些嵌入及使用它们的下游系统,在管理嵌入训练数据、衡量嵌入质量以及监控使用嵌入的下游模型方面带来了新的挑战。这些挑战在标准特征存储中基本未被解决。本教程的目标是介绍特征存储系统,并讨论管理这些以嵌入为中心的新流水线的挑战与当前解决方案。
引用
@article{arxiv.2108.05053,
title = {Managing ML Pipelines: Feature Stores and the Coming Wave of Embedding Ecosystems},
author = {Laurel Orr and Atindriyo Sanyal and Xiao Ling and Karan Goel and Megan Leszczynski},
journal= {arXiv preprint arXiv:2108.05053},
year = {2021}
}