EMLIO:面向大规模 AI 训练的 I/O 延迟与能耗最小化
分布式、并行与集群计算
2025-08-18 v1
摘要
大规模深度学习工作负载因数据集超出本地存储容量且 GPU 计算速度超过网络和磁盘延迟而日益受到 I/O 瓶颈的制约。虽然最近的系统优化了数据加载时间,但忽视了 I/O 的能耗成本——这一因素在大规模环境下至关重要。我们引入 EMLIO,一种高效的机器学习 I/O 服务,旨在可变延迟的网络存储环境下联合最小化端到端数据加载延迟 T 和 I/O 能耗 E。EMLIO 在存储节点上部署轻量级数据服务守护进程,对原始样本进行序列化和批量处理,通过 TCP 传输并采用超出序的预取,同时在客户端侧无缝集成基于 GPU 加速 (NVIDIA DALI) 的预处理。在本地磁盘、LAN (0.05 ms & 10 ms RTT) 和 WAN (30 ms RTT) 环境下的全面评估表明,EMLIO 比最先进的加载器实现了最高 8.6 倍的 I/O 速度和 10.9 倍的能耗降低,同时保持恒定的性能和能耗轮廓,无论网络距离如何。EMLIO 的服务化架构为能源感知的下一代 AI 云提供了一个可扩展的蓝图。
引用
@article{arxiv.2508.11035,
title = {EMLIO: Minimizing I/O Latency and Energy Consumption for Large-Scale AI Training},
author = {Hasibul Jamil and MD S Q Zulkar Nine and Tevfik Kosar},
journal= {arXiv preprint arXiv:2508.11035},
year = {2025}
}
备注
SC25 Sustainable Supercomputing Workshop