面向科学发现的万亿参数AI推理基础设施:综述与愿景
机器学习
2024-02-07 v1 人工智能
分布式、并行与集群计算
摘要
深度学习方法正在变革科学研究,催生新技术,并最终带来新发现。随着对能力更强的AI模型的需求持续增长,我们正迈入万亿参数模型(Trillion Parameter Models, TPM)时代,即参数规模超过一万亿的模型——例如华为的盘古-Σ(PanGu-Σ)。我们描绘了一个面向科学界特定需求的TPM用户与提供商生态系统的愿景。随后,我们概述了在服务于TPM以赋能科学研究和发现的系统设计中存在的重大技术挑战和开放性问题。具体而言,我们阐述了一个全面的软件栈和接口的需求,以支持研究人员多样化且灵活的要求。
引用
@article{arxiv.2402.03480,
title = {Trillion Parameter AI Serving Infrastructure for Scientific Discovery: A Survey and Vision},
author = {Nathaniel Hudson and J. Gregory Pauloski and Matt Baughman and Alok Kamatar and Mansi Sakarvadia and Logan Ward and Ryan Chard and André Bauer and Maksim Levental and Wenyi Wang and Will Engler and Owen Price Skelly and Ben Blaiszik and Rick Stevens and Kyle Chard and Ian Foster},
journal= {arXiv preprint arXiv:2402.03480},
year = {2024}
}
备注
10 pages, 3 figures, accepted for publication in the proceedings of the 10th IEEE/ACM International Conference on Big Data Computing, Applications and Technologies (BDCAT2023)