面向高性能数据科学与数据工程的 HPTMT 并行算子
分布式、并行与集群计算
2021-08-16 v1 人工智能
摘要
数据密集型应用在所有科学学科中正变得司空见惯。它们由数据工程、深度学习和机器学习等丰富的子领域组成。这些应用围绕适合不同领域应用的高效数据抽象与算子构建。该领域往往缺乏清晰的数据结构与算子定义,导致其他实现彼此不能良好协作。我们最近提出的 HPTMT 架构,确定了一组数据结构、算子以及执行模型,用于创建将 data engineering 与 data science 各方面高效联结的丰富数据应用。本文通过一个深度学习与数据工程部分协同工作的端到端应用,对该架构进行详述与说明。
引用
@article{arxiv.2108.06001,
title = {HPTMT Parallel Operators for High Performance Data Science & Data Engineering},
author = {Vibhatha Abeykoon and Supun Kamburugamuve and Chathura Widanage and Niranda Perera and Ahmet Uyar and Thejaka Amila Kanewala and Gregor von Laszewski and Geoffrey Fox},
journal= {arXiv preprint arXiv:2108.06001},
year = {2021}
}