中文

HPC系统上机器学习应用中的I/O:一项全景综述

分布式、并行与集群计算 2025-08-26 v3 人工智能 机器学习

摘要

对人工智能(AI)日益增长的兴趣导致了对机器学习(ML)模型训练和推理更快方法的需求激增。这种对速度的需求促使人们使用擅长管理分布式工作负载的高性能计算(HPC)系统。由于数据是AI应用的主要燃料,HPC系统的存储和I/O性能至关重要。过去,HPC应用访问的是模拟或实验产生的大型数据块,或为可视化或分析任务摄取数据。而ML工作负载则执行分散在大量随机文件上的小规模读取。这种I/O模式的转变对现代并行存储系统提出了诸多挑战。在本文中,我们综述了HPC系统上ML应用中的I/O,并针对2019年至2024年的六年时间窗口进行了调研。我们定义了综述的范围,概述了ML的常见阶段,回顾了可用的分析器和基准测试,考察了离线数据准备、训练和推理过程中遇到的I/O模式,并探讨了现代ML框架中采用及近期文献中提出的I/O优化方法。最后,我们试图揭示可能引发进一步研发的研究空白。

关键词

引用

@article{arxiv.2404.10386,
  title  = {I/O in Machine Learning Applications on HPC Systems: A 360-degree Survey},
  author = {Noah Lewis and Jean Luca Bez and Surendra Byna},
  journal= {arXiv preprint arXiv:2404.10386},
  year   = {2025}
}