基于易失性实例的机器学习
机器学习
2020-03-13 v1 分布式、并行与集群计算
机器学习
摘要
由于当今机器学习中使用的神经网络模型与训练数据集规模巨大,必须通过将在多个工作节点间拆分梯度评估等任务来分布式执行随机梯度下降(SGD)。然而,运行分布式SGD可能成本高昂,因为它可能需要GPU等专用计算资源长时间运行。我们提出经济高效的策略,以利用比标准实例便宜但可能被更高优先级工作负载中断的易失性云实例。据我们所知,本工作是首个量化活跃工作节点数量变化(由抢占导致)如何影响SGD收敛与模型训练时间的工作。通过理解实例抢占概率、准确率与训练时间之间的权衡,我们能够推导在易失性实例(如Amazon EC2 spot实例及其他可抢占云实例)上配置分布式SGD作业的实用策略。实验结果表明,我们的策略以显著降低的成本取得了良好的训练性能。
引用
@article{arxiv.2003.05649,
title = {Machine Learning on Volatile Instances},
author = {Xiaoxi Zhang and Jianyu Wang and Gauri Joshi and Carlee Joe-Wong},
journal= {arXiv preprint arXiv:2003.05649},
year = {2020}
}