中文

GBA:一种在推荐模型同步与异步训练间无缝切换的免调参方法

机器学习 2022-10-11 v2 分布式、并行与集群计算 信息检索

摘要

基于参数服务器(PS)架构的高并发异步训练与基于全归约(AR)架构的高性能同步训练是推荐模型中最常部署的分布式训练模式。尽管同步AR训练被设计为具有更高的训练效率,但当共享集群中存在掉队者(慢节点)时,尤其是在计算资源有限的情况下,异步PS训练在训练速度上会是更好的选择。充分利用这两种训练模式的理想方式是根据集群状态在二者间切换。然而,切换训练模式通常需要调整超参数,这极其耗费时间与资源。我们发现实现免调参方法存在两个障碍:梯度值分布不同以及来自掉队者的陈旧梯度。本文提出基于PS的全局批次梯度聚合(GBA),其以与同步训练相同的全局批次大小聚合并应用梯度。通过令牌控制过程来组装梯度并对严重陈旧的梯度进行衰减。我们提供了收敛性分析,揭示GBA具有与同步训练相当的收敛特性,并证明了GBA在推荐模型中对梯度陈旧性的鲁棒性。在三个工业级推荐任务上的实验表明,GBA是一种有效的免调参切换方法。与最先进的派生异步训练相比,GBA在AUC指标上实现了高达0.2%的提升,这对推荐模型而言是显著的。同时,在紧张的硬件资源下,GBA相比同步训练至少加速2.4倍。

关键词

引用

@article{arxiv.2205.11048,
  title  = {GBA: A Tuning-free Approach to Switch between Synchronous and Asynchronous Training for Recommendation Model},
  author = {Wenbo Su and Yuanxing Zhang and Yufeng Cai and Kaixu Ren and Pengjie Wang and Huimin Yi and Yue Song and Jing Chen and Hongbo Deng and Jian Xu and Lin Qu and Bo zheng},
  journal= {arXiv preprint arXiv:2205.11048},
  year   = {2022}
}