中文

Koji:使用混合语义数据源实现流水线自动化

分布式、并行与集群计算 2019-01-08 v1

摘要

我们提出了一种新的面向结果的语义,用于以统一方式定义处理不同语义形式(文件或服务)数据的数据处理工作流。该方法使用户能够以简单的声明式方式定义大量可复现的数据处理任务的工作流,其聚焦于应用层结果,同时在幕后自动处理所有控制平面考量(如不失进度的故障恢复与计算复用)。将文件与服务作为数据的统一处理便于与现有数据源(如数据采集 API)与数据接收端(如数据库服务)集成。而将容器作为变换的聚焦则实现了现有数据处理系统的复用。我们描述了一种声明式配置机制,其可被视为可复现数据处理流水线的中间表示(IR),正如例如 TensorFlow\cite{tensorflow} 与 ONNX\cite{onnx} 利用 IR 定义张量处理流水线一样。

关键词

引用

@article{arxiv.1901.01908,
  title  = {Koji: Automating pipelines with mixed-semantics data sources},
  author = {Petar Maymounkov},
  journal= {arXiv preprint arXiv:1901.01908},
  year   = {2019}
}