中文

面向高性能数据科学与数据工程的 HPTMT 并行算子

分布式、并行与集群计算 2021-08-16 v1 人工智能

摘要

数据密集型应用在所有科学学科中正变得司空见惯。它们由数据工程、深度学习和机器学习等丰富的子领域组成。这些应用围绕适合不同领域应用的高效数据抽象与算子构建。该领域往往缺乏清晰的数据结构与算子定义,导致其他实现彼此不能良好协作。我们最近提出的 HPTMT 架构,确定了一组数据结构、算子以及执行模型,用于创建将 data engineering 与 data science 各方面高效联结的丰富数据应用。本文通过一个深度学习与数据工程部分协同工作的端到端应用,对该架构进行详述与说明。

关键词

引用

@article{arxiv.2108.06001,
  title  = {HPTMT Parallel Operators for High Performance Data Science & Data Engineering},
  author = {Vibhatha Abeykoon and Supun Kamburugamuve and Chathura Widanage and Niranda Perera and Ahmet Uyar and Thejaka Amila Kanewala and Gregor von Laszewski and Geoffrey Fox},
  journal= {arXiv preprint arXiv:2108.06001},
  year   = {2021}
}