DeepRecSys:一种用于优化大规模端到端神经推荐推理的系统
分布式、并行与集群计算
2020-01-10 v1
摘要
神经个性化推荐是广泛云服务和产品的基石,构成了云基础设施的显著计算需求。因此,提升神经推荐的执行效率可直接转化为基础设施容量的节省。在本文中,我们设计了一种新颖的端到端建模基础设施 DeepRecInfra,它采用算法与系统协同设计方法论,为推荐用例定制设计系统。借助推荐表征分析所得的洞见,提出了一种新的动态调度器 DeepRecSched,通过考虑推理查询规模与到达模式、推荐模型架构以及底层硬件系统的特征,来最大化延迟受限吞吐量。由此,系统吞吐量在八个业界代表性推荐模型中翻倍。最后,在大规模生产数据中心的部署与评估显示,在数百台机器上运行的各类推荐模型中实现了超过 30% 的延迟降低。
引用
@article{arxiv.2001.02772,
title = {DeepRecSys: A System for Optimizing End-To-End At-scale Neural Recommendation Inference},
author = {Udit Gupta and Samuel Hsia and Vikram Saraph and Xiaodong Wang and Brandon Reagen and Gu-Yeon Wei and Hsien-Hsin S. Lee and David Brooks and Carole-Jean Wu},
journal= {arXiv preprint arXiv:2001.02772},
year = {2020}
}