中文

Hercules:面向大规模个性化推荐的异构感知推理服务系统

分布式、并行与集群计算 2022-03-16 v1

摘要

个性化推荐是一类重要的深度学习应用,支撑着大量互联网服务并消耗可观的数据中心资源。随着生产级推荐系统规模持续增长,在异构数据中心中优化其服务性能与效率十分重要,并可转化为基础设施容量节省。本文提出 Hercules,一个针对多样化业界代表性模型与云规模异构系统的个性化推荐推理服务优化框架。Hercules 执行两阶段优化流程——离线分析与在线服务。第一阶段以基于梯度的搜索算法探索未被充分研究的大型任务调度空间,在单台服务器上实现高达 9.0 倍的延迟受限吞吐提升;它还为每个推荐负载确定最优异构服务器架构。第二阶段执行异构感知的集群资源调配,以优化资源映射与分配,应对波动的日间负载。Hercules 所提出的集群调度器相较最先进的贪心调度器实现了 47.7% 的集群容量节省,并将已配置功率降低 23.7%。

关键词

引用

@article{arxiv.2203.07424,
  title  = {Hercules: Heterogeneity-Aware Inference Serving for At-Scale Personalized Recommendation},
  author = {Liu Ke and Udit Gupta and Mark Hempstead and Carole-Jean Wu and Hsien-Hsin S. Lee and Xuan Zhang},
  journal= {arXiv preprint arXiv:2203.07424},
  year   = {2022}
}