中文

规模化科学AI的数据准备

人工智能 2025-08-01 v1 计算工程、金融与科学 分布式、并行与集群计算 机器学习

摘要

本文考察了数据准备用于AI(DRAI)原则如何应用于用于训练基础模型的领导层级科学数据集。我们分析了四个代表性领域——气候、核聚变、生物/健康和材料——中的典型工作流程,以识别常见的预处理模式和领域特定的约束。我们引入了一个由数据准备水平(从原始到AI就绪)和数据处理阶段(从摄取到分片)组成的二维准备框架,两者都针对高性能计算(HPC)环境进行了优化。该框架概述了将科学数据转化为可扩展AI训练所需面临的关键挑战,强调以Transformer为基础的生成模型。正是这两个维度共同构成了一个概念成熟矩阵,用于表征科学数据准备情况,并指导基础设施开发,以实现标准化、跨域支持,从而支持可扩展且可重复的科学AI。

关键词

引用

@article{arxiv.2507.23018,
  title  = {Data Readiness for Scientific AI at Scale},
  author = {Wesley Brewer and Patrick Widener and Valentine Anantharaj and Feiyi Wang and Tom Beck and Arjun Shankar and Sarp Oral},
  journal= {arXiv preprint arXiv:2507.23018},
  year   = {2025}
}

备注

10 pages, 1 figure, 2 tables