tf.data service:解耦机器学习输入数据处理的一个案例
强关联电子
2023-03-31 v2 材料科学
摘要
机器学习(ML)计算通常在昂贵的专用硬件(如 GPU 和 TPU)上执行,这些硬件提供高 FLOPs 和每瓦性能。为了实现成本效益,必须使这些加速器保持高利用率。这要求以加速器能够摄取并对其执行 ML 计算的速率对输入数据进行预处理。为避免数据停顿,用于每个 ML 计算加速器核心的输入数据处理所需的主机 CPU 和 RAM 因作业而异。因此,在 ML 加速器主机上以固定硬件比例处理输入数据的传统方法,会导致加速器或主机 CPU 和 RAM 的利用率不足。在本文中,我们通过构建一个解耦的 ML 数据处理系统来解决这些问题。我们提出了 tf.data service,这是一个构建于 TensorFlow 中 tf.data 之上的开源解耦输入数据处理服务。我们表明,解耦数据预处理对大规模 ML 训练作业具有三个关键优势。首先,该服务可以水平扩展,为每个作业中的数据处理调整 CPU/RAM 主机资源至合适规模,平均节省 32 倍的训练时间和 26 倍的成本。其次,该服务可以跨作业共享临时的预处理数据结果,以优化 CPU 使用并减少冗余计算。最后,该服务支持协调读取,这是一种在分布式训练中避免因输入大小不同而导致落后者的技术,平均可将训练时间减少 2.2 倍。我们的设计受到了在生产环境中部署 tf.data service 的经验启发,包括在不影响模型精度的情况下放宽数据访问保证。
引用
@article{arxiv.2210.14825,
title = {Thermoelectric properties in semimetals with inelastic electron-hole scattering},
author = {Keigo Takahashi and Hiroyasu Matsuura and Hideaki Maebashi and Masao Ogata},
journal= {arXiv preprint arXiv:2210.14825},
year = {2023}
}
备注
8 pages, 4 figures + Supplemental Material