BagPipe:加速深度推荐模型训练
分布式、并行与集群计算
2023-11-02 v4 机器学习
摘要
基于深度学习的推荐模型(DLRM)广泛用于若干业务关键应用。高效训练此类推荐模型颇具挑战,因其包含数十亿基于嵌入的参数,导致嵌入访问的显著开销。通过对现有 DLRM 训练系统画像,我们观察到约 75% 的迭代时间耗费在嵌入访问与模型同步上。本文的核心见解是,嵌入访问具有特定结构,可用于加速训练。我们观察到嵌入访问高度倾斜,约 1% 的嵌入占据了超 92% 的总访问量。此外,我们观察到离线训练时可前瞻未来批次,精确确定未来哪次迭代需要哪些嵌入。基于这些见解,我们开发了 Bagpipe,一个利用缓存与预取将远程嵌入访问与计算重叠的深度学习推荐模型训练系统。我们设计了 Oracle Cacher,一种利用前瞻算法生成最优缓存更新决策、同时对陈旧性提供强一致性保证的新组件。我们还设计了逻辑复制、物理分区的缓存,并表明该设计可降低分布式环境下的同步开销。最后,我们提出一种解耦系统架构,并表明该设计可实现低开销容错。基于三个数据集与四个模型的实验显示,Bagpipe 相较 SOTA 基线最高加速 5.6 倍,同时提供与同步训练相同的收敛性与可复现性保证。
引用
@article{arxiv.2202.12429,
title = {BagPipe: Accelerating Deep Recommendation Model Training},
author = {Saurabh Agarwal and Chengpo Yan and Ziyi Zhang and Shivaram Venkataraman},
journal= {arXiv preprint arXiv:2202.12429},
year = {2023}
}