中文

JITA4DS:边缘与数据中心间数据科学流水线的分解式执行

分布式、并行与集群计算 2021-08-21 v1

摘要

本文面向数据科学(DS)流水线的执行,该执行由数据处理、传输与共享支撑,并在执行贪婪进程的多个资源上展开。当前的数据科学流水线环境提供各类基础设施服务,配备通用处理器(GPP)、图形处理单元(GPU)、现场可编程门阵列(FPGA)和张量处理单元(TPU)等计算资源,并结合平台与软件服务以设计、运行和维护 DS 流水线。这些“一刀切”的方案强制将数据处理流水线任务完全外包。然而,部分任务可在边缘执行,后端可提供即时资源以保障专用且弹性的执行环境。本文提出一种创新的、用于配置数据中心以支撑数据科学流水线的可组合“即时架构”(JITA-4DS)及相应的资源管理技术。JITA-4DS 是一个跨层管理系统,同时感知应用特征与底层基础设施,以打破应用、中间件/操作系统与硬件层之间的壁垒。这些层的垂直集成对于构建可定制的虚拟数据中心(VDC)是必要的,以满足动态变化的数据科学流水线在性能、可用性和能耗等方面的需求。据此,本文展示了用于运行数据科学工作负载并确定 JITA-4DS 所实现资源分配调度最佳策略的实验仿真。

关键词

引用

@article{arxiv.2108.02558,
  title  = {JITA4DS: Disaggregated execution of Data Science Pipelines between the Edge and the Data Centre},
  author = {Genoveva Vargas-Solar and Ali Akoglu and Md Sahil Hassan},
  journal= {arXiv preprint arXiv:2108.02558},
  year   = {2021}
}

备注

This paper has been submitted to a Journal JWE special number. arXiv admin note: substantial text overlap with arXiv:2103.07978