Ravnest:异构设备上的去中心化异步训练
机器学习
2024-05-24 v2 人工智能
分布式、并行与集群计算
摘要
现代深度学习模型日益庞大和复杂,由于在海量数据集上训练,展现出卓越的泛化能力和准确性。这一趋势预计将持续。然而,这些模型规模的不断增长给训练带来了挑战,因为传统的集中式方法在此等规模下受限于内存约束。本文提出了一种针对大型现代深度学习模型的异步去中心化训练范式,该范式利用通过互联网连接的、资源有限的常规异构个人计算机的计算能力,以实现优越的性能指标。Ravnest通过将计算节点高效组织成具有相似数据传输速率和计算能力的集群来促进去中心化训练,而无需每个节点托管整个模型。这些集群进行“零气泡异步模型并行”训练,并采用“并行多环全归约”方法在所有集群间有效执行全局参数平均。我们将异步SGD损失函数构建为一个具有延迟更新的块结构优化问题,并推导出最优收敛速率。我们进一步讨论了相对于参与集群数量的线性加速以及陈旧性参数的界限。
引用
@article{arxiv.2401.01728,
title = {Ravnest: Decentralized Asynchronous Training on Heterogeneous Devices},
author = {Anirudh Rajiv Menon and Unnikrishnan Menon and Kailash Ahirwar},
journal= {arXiv preprint arXiv:2401.01728},
year = {2024}
}
备注
29 pages, 6 figures