中文

ECRM:基于纠删码实现推荐模型训练的高效容错

机器学习 2021-04-06 v1 分布式、并行与集群计算

摘要

基于深度学习的推荐模型(DLRM)被广泛部署以为用户提供个性化内容。由于使用大型嵌入表,DLRM 规模庞大,并通过将模型分布到数十或数百台服务器的内存中进行训练。在此类大型分布式系统中,服务器故障十分常见,必须加以缓解以使得训练能够进行。检查点是这些系统中用于容错的主要方法,但在正常运行和从故障恢复时都会带来显著的训练时间开销。随着 DLRM 规模增大,这些开销也随之增加,检查点预计将成为未来预期规模增长的 DLRM 的更大开销。这呼吁重新思考 DLRM 训练中的容错。我们提出 ECRM,一种利用纠删码实现高效容错的 DLRM 训练系统。ECRM 选择要编码的 DLRM 参数,正确且高效地更新校验块,并使训练无需任何暂停即可进行,同时保持恢复参数的一致性。我们在工业级开源 DLRM 训练系统 XDL 上实现了 ECRM。与检查点相比,ECRM 将大型 DLRM 的训练时间开销降低多达 88%,从故障中恢复的速度最高快 10.3×\times,并允许在恢复期间继续训练。这些结果表明了纠删码在为当前及未来 DLRM 提供高效容错方面的前景。

关键词

引用

@article{arxiv.2104.01981,
  title  = {ECRM: Efficient Fault Tolerance for Recommendation Model Training via Erasure Coding},
  author = {Kaige Liu and Jack Kosaian and K. V. Rashmi},
  journal= {arXiv preprint arXiv:2104.01981},
  year   = {2021}
}