中文

数据集生命周期框架及其在生物信息学中的应用

分布式、并行与集群计算 2021-07-01 v1 新兴技术

摘要

生物信息学流水线依赖共享 POSIX 文件系统来存储其输入、输出及中间数据。容器化使得工作负载更难访问共享文件系统。在我们先前的研究中,我们能够在 Kubeflow 上成功运行 ML 与非 ML 流水线。然而,存储方案复杂且不够优化。这是因为 Kubernetes 上尚无既定的资源类型来表示数据源这一概念。越来越多的应用运行在 Kubernetes 上进行批处理。终端用户背负着配置和优化数据访问的负担,这正是我们此前所经历的。在本文中,我们引入 Dataset 这一新概念及其对应的资源,作为原生的 Kubernetes 对象。我们利用数据集生命周期框架(Dataset Lifecycle Framework, DLF)来处理 Kubernetes pod 中有关数据访问的所有底层细节。其可插拔架构专为开发缓存、调度与治理插件而设计。它们共同管理自定义资源 Dataset 的整个生命周期。我们使用数据集生命周期框架将对象存储中的数据提供给运行在 Kubeflow 上的 ML 与非 ML 流水线。借助 DLF,我们使训练数据直接喂入 ML 模型而无需下载到本地磁盘,从而实现了输入的可扩展性。我们通过将训练元数据存入数据集增强了其持久性,这也简化了 Tensorboard 的设置,使其与笔记本服务器分离。对于非 ML 流水线,我们通过动态注入数据集简化了 1000 基因组计划流水线。此外,我们的初步结果表明可插拔缓存机制能显著提升性能。

关键词

引用

@article{arxiv.2103.00490,
  title  = {Dataset Lifecycle Framework and its applications in Bioinformatics},
  author = {Yiannis Gkoufas and David Yu Yuan},
  journal= {arXiv preprint arXiv:2103.00490},
  year   = {2021}
}