中文

面向大规模深度推荐模型的 GPU 专用推理参数服务器

信息检索 2022-10-18 v1 人工智能 分布式、并行与集群计算 机器学习

摘要

推荐系统对于新闻推送、社交网络、电子商务、搜索等多种现代应用与网络服务至关重要。为达到最佳预测精度,现代推荐模型将深度学习与太字节级嵌入表相结合,以获得底层数据的细粒度表示。传统的推理服务架构需将整个模型部署到独立服务器,在此海量规模下不可行。本文深入剖析在线推荐系统这一引人关注且具挑战性的推理领域。我们提出 HugeCTR 分层参数服务器(HPS),一种业界领先的分布式推荐推理框架,其将高性能 GPU 嵌入缓存与分层存储架构相结合,以实现在线模型推理任务中嵌入的低延迟检索。除其他特性外,HPS 具备(1)冗余分层存储系统,(2)用于在 NVIDIA GPU 上加速并行嵌入查找的新型高带宽缓存,(3)在线训练支持,以及(4)便于集成至现有大规模推荐工作流的轻量级 API。为展示其能力,我们使用合成构建与公开数据集开展了广泛研究。结果表明,我们的 HPS 可大幅降低端到端推理延迟,在热门推荐模型上相比 CPU 基线实现 5~62 倍(取决于批大小)的加速。通过多 GPU 并发部署,HPS 还可大幅提升推理 QPS。

关键词

引用

@article{arxiv.2210.08804,
  title  = {A GPU-specialized Inference Parameter Server for Large-Scale Deep Recommendation Models},
  author = {Yingcan Wei and Matthias Langer and Fan Yu and Minseok Lee and Kingsley Liu and Jerry Shi and Joey Wang},
  journal= {arXiv preprint arXiv:2210.08804},
  year   = {2022}
}

备注

12 pages