中文

JIZHI:百度面向网页规模在线推理的快速且高性价比模型即服务系统

信息检索 2021-06-04 v1 分布式、并行与集群计算 机器学习

摘要

在现代互联网行业中,基于深度学习的推荐系统已成为搜索、新闻推送和短视频等广泛应用不可或缺的组成部分。然而,面对来自数十亿用户的时变网页规模流量,如何以高性价比的方式将训练好的深度模型用于在线实时推理服务,仍然是一项挑战。在本工作中,我们提出 JIZHI——一个模型即服务(Model-as-a-Service)系统——它每秒处理数亿次面向超大规模深度模型(含超过万亿稀疏参数)的在线推理请求,服务于百度公司的二十余个实时推荐业务。在 JIZHI 中,每个推荐请求的推理工作流被转化为分阶段事件驱动流水线(Staged Event-Driven Pipeline, SEDP),其中流水线的每个节点对应一个分阶段的计算或 I/O 密集型任务处理器。随着实时推理请求流量到达,每个模块化处理器可以完全异步方式运行并独立管理。此外,JIZHI 引入异构分层存储,通过减少不必要的计算以及由超稀疏模型参数引起的潜在数据访问延迟,进一步加速在线推理过程。同时,系统部署了智能资源管理器,通过从历史日志中搜索最优资源分配方案并基于中间系统反馈微调丢载策略,在共享基础设施上最大化 JIZHI 的吞吐率。我们进行了大量实验,从端到端服务延迟、系统级吞吐率和资源消耗等方面证明 JIZHI 的优势。JIZHI 已帮助百度在推理效率不降的前提下多处理 200% 的流量,节省超过一千万美元的硬件与公用设施成本。

关键词

引用

@article{arxiv.2106.01674,
  title  = {JIZHI: A Fast and Cost-Effective Model-As-A-Service System for Web-Scale Online Inference at Baidu},
  author = {Hao Liu and Qian Gao and Jiang Li and Xiaochao Liao and Hao Xiong and Guangxing Chen and Wenlin Wang and Guobao Yang and Zhiwei Zha and Daxiang Dong and Dejing Dou and Haoyi Xiong},
  journal= {arXiv preprint arXiv:2106.01674},
  year   = {2021}
}

备注

Accepted to SIGKDD 2021 applied data science track