基于参数服务的弹性模型聚合
分布式、并行与集群计算
2022-04-08 v1
摘要
模型聚合,即更新模型参数的过程,是分布式深度学习(DDL)中模型收敛的重要步骤。然而,参数服务器(PS)——一种执行模型聚合的流行范式——由于聚合的突发特性和静态资源分配,导致深度学习(DL)集群中的 CPU 利用率不足。为补救该问题,我们提出参数服务(Parameter Service),一种面向 DDL 训练的弹性模型聚合框架,它将模型聚合功能与各个训练任务解耦,并为集群中所有任务提供共享的模型聚合服务。在参数服务中,模型聚合被高效打包并动态迁移以适配可用 CPU,且时间开销可忽略。此外,参数服务可基于其负载弹性管理其 CPU 资源以提升资源效率。我们已在名为 AutoPS 的原型系统中实现参数服务,并通过测试床实验和轨迹驱动仿真进行评估。AutoPS 在训练任务性能影响极小或无影响的情况下,最多减少 75% 的 CPU 消耗。参数服务的设计对用户透明,并可集成到流行的 DL 框架中。
引用
@article{arxiv.2204.03211,
title = {Elastic Model Aggregation with Parameter Service},
author = {Juncheng Gu and Mosharaf Chowdhury and Kang G. Shin and Aditya Akella},
journal= {arXiv preprint arXiv:2204.03211},
year = {2022}
}