面向大规模深度推荐模型的 GPU 专用推理参数服务器
信息检索
2022-10-18 v1 人工智能
分布式、并行与集群计算
机器学习
摘要
推荐系统对于新闻推送、社交网络、电子商务、搜索等多种现代应用与网络服务至关重要。为达到最佳预测精度,现代推荐模型将深度学习与太字节级嵌入表相结合,以获得底层数据的细粒度表示。传统的推理服务架构需将整个模型部署到独立服务器,在此海量规模下不可行。本文深入剖析在线推荐系统这一引人关注且具挑战性的推理领域。我们提出 HugeCTR 分层参数服务器(HPS),一种业界领先的分布式推荐推理框架,其将高性能 GPU 嵌入缓存与分层存储架构相结合,以实现在线模型推理任务中嵌入的低延迟检索。除其他特性外,HPS 具备(1)冗余分层存储系统,(2)用于在 NVIDIA GPU 上加速并行嵌入查找的新型高带宽缓存,(3)在线训练支持,以及(4)便于集成至现有大规模推荐工作流的轻量级 API。为展示其能力,我们使用合成构建与公开数据集开展了广泛研究。结果表明,我们的 HPS 可大幅降低端到端推理延迟,在热门推荐模型上相比 CPU 基线实现 5~62 倍(取决于批大小)的加速。通过多 GPU 并发部署,HPS 还可大幅提升推理 QPS。
引用
@article{arxiv.2210.08804,
title = {A GPU-specialized Inference Parameter Server for Large-Scale Deep Recommendation Models},
author = {Yingcan Wei and Matthias Langer and Fan Yu and Minseok Lee and Kingsley Liu and Jerry Shi and Joey Wang},
journal= {arXiv preprint arXiv:2210.08804},
year = {2022}
}
备注
12 pages