中文

ScaleFreeCTR:基于MixCache的面向海量嵌入表CTR模型分布式训练系统

信息检索 2021-05-12 v2 人工智能 分布式、并行与集群计算 机器学习

摘要

由于深度学习具有优越的特征表示能力,各家工业公司在其商业系统中部署了多种深度点击率(CTR)模型。为获得更好的性能,有必要在海量训练数据上高效地训练深度CTR模型,这使得加速训练过程成为一个关键问题。与具有稠密训练数据的模型不同,CTR模型的训练数据通常是高维且稀疏的。为了将高维稀疏输入转换为低维稠密实值向量,几乎所有深度CTR模型都采用了嵌入层,其规模轻易达到数百GB甚至TB级。由于单块GPU无法容纳所有嵌入参数,在执行分布式训练时,仅采用数据并行是不合理的。因此,现有的推荐系统分布式训练平台采用了模型并行:具体而言,它们利用服务器的CPU(主机)内存来维护和更新嵌入参数,并利用GPU工作节点进行前向与反向计算。遗憾的是,这些平台存在两个瓶颈:(1)主机与GPU之间拉取(pull)和推送(push)操作的延迟;(2)CPU服务器中的参数更新与同步。为解决这些瓶颈,本文提出ScaleFreeCTR:一种基于MixCache的CTR模型分布式训练系统。具体而言,在SFCTR中,我们同样将海量嵌入表存储于CPU中,但利用GPU而非CPU来高效地执行嵌入同步。为降低GPU-主机与GPU-GPU之间数据传输的延迟,我们提出了MixCache机制与虚拟稀疏ID(Virtual Sparse Id)操作。我们进行了充分的实验与消融研究,以证明SFCTR的有效性与高效性。

关键词

引用

@article{arxiv.2104.08542,
  title  = {ScaleFreeCTR: MixCache-based Distributed Training System for CTR Models with Huge Embedding Table},
  author = {Huifeng Guo and Wei Guo and Yong Gao and Ruiming Tang and Xiuqiang He and Wenzhi Liu},
  journal= {arXiv preprint arXiv:2104.08542},
  year   = {2021}
}

备注

10 pages