中文

HPTMT:基于算子架构的可扩展高性能数据密集型框架

分布式、并行与集群计算 2021-08-02 v2 人工智能

摘要

数据密集型应用影响诸多领域,其规模和复杂度的持续增长要求具备高性能、高易用性的环境。我们整合了在各种数据科学与数据工程框架中发展出的一系列思想。这些框架在特定数据抽象(包括向量、矩阵、张量、图和表)上运用一组算子。我们的关键概念受 MPI、HPF (High-Performance Fortran)、NumPy、Pandas、Spark、Modin、PyTorch、TensorFlow、RAPIDS(NVIDIA) 和 OneAPI (Intel) 等系统的启发。此外,支持大数据领域日常使用的不同语言(包括 Python、R、C++ 和 Java)至关重要。我们注意到 Apache Arrow 和 Parquet 对于实现语言无关的高性能与互操作性十分重要。本文中,我们提出高性能张量、矩阵与表(HPTMT),一种面向数据密集型应用的基于算子的架构,并指明性能与易用性成功所需的基本原理。我们通过使用体现 HPTMT 的软件环境 Cylon 和 Twister2 的讨论来阐释这些原理。

关键词

引用

@article{arxiv.2107.12807,
  title  = {HPTMT: Operator-Based Architecture for Scalable High-Performance Data-Intensive Frameworks},
  author = {Supun Kamburugamuve and Chathura Widanage and Niranda Perera and Vibhatha Abeykoon and Ahmet Uyar and Thejaka Amila Kanewala and Gregor von Laszewski and Geoffrey Fox},
  journal= {arXiv preprint arXiv:2107.12807},
  year   = {2021}
}