中文

在 SKA 背景下提供无服务器科学流水线的方法

分布式、并行与集群计算 2024-10-30 v2

摘要

函数即服务(FaaS)是一种无服务器计算,允许开发者将代码编写并部署为独立函数,由特定事件或请求触发。FaaS 平台自动管理底层基础设施,按需伸缩,具有高可扩展性、高成本效益并提供高度抽象。SKA 区域中心网络(SRCNet)内开发的原型正在探索数据分发、软件交付与分布式计算模型,旨在将计算移动并执行到数据所在之处。由于 SKA 将成为地球上最大的数据生产者,有必要将这一海量数据分发至作为最近数据计算与分析操作枢纽的 SRCNet 节点。在此背景下,本工作希望验证在 FaaS 平台内设计和部署射电干涉测量工作流中常用函数与应用的可行性,以证明该计算模型作为 SRCNet 分布式节点数据处理替代方案的价值。我们分析了若干 FaaS 平台并成功部署其中之一,通过两种不同方法导入多个函数:来自 CASA 框架的用 Python 代码编写的微函数,以及如 wsclean 这类高度专用的原生应用。因此,我们设计了一个简单目录,可轻松扩展以在高度分布式环境中利用编排器提供 FaaS 所有关键特性,并能将其与工作流或 API 集成。本文对 FaaS 模型用于科学数据处理的潜力(尤其在 SKA 等大规模分布式项目背景下)的持续讨论作出贡献。

关键词

引用

@article{arxiv.2306.09728,
  title  = {An approach to provide serverless scientific pipelines within the context of SKA},
  author = {Carlos Ríos-Monje and Manuel Parra-Royón and Javier Moldón and Susana Sánchez-Expósito and Julián Garrido and Laura Darriba and MAngeles Mendoza and Jesús Sánchez and Lourdes Verdes-Montenegro and Jesús Salgado},
  journal= {arXiv preprint arXiv:2306.09728},
  year   = {2024}
}

备注

6