中文

深度推荐系统的跨栈工作负载表征

硬件体系结构 2020-10-13 v1 分布式、并行与集群计算 信息检索

摘要

基于深度学习的推荐系统构成了大多数个性化云服务的主干。尽管计算机体系结构界最近开始关注深度推荐推理,但所得解决方案采取了迥异的方法——从近内存处理到规模化优化。为了更好地设计面向深度推荐推理的未来硬件系统,我们必须首先系统审视并表征执行栈不同层级上设计决策带来的底层系统级影响。在本文中,我们在执行栈的三个不同层级——算法与软件、系统平台、硬件微体系结构——对八个具行业代表性的深度推荐模型进行表征。通过此跨栈表征,我们首先表明系统部署选择(即CPU或GPU、批大小粒度)可带来高达15倍的加速。为更好理解进一步优化的瓶颈,我们考察了软件算子使用分解以及CPU前端与后端微体系结构低效性。最后,我们对关键算法模型架构特征与硬件瓶颈之间的相关性建模,揭示出每个硬件瓶颈背后均不存在单一主导算法组件。

关键词

引用

@article{arxiv.2010.05037,
  title  = {Cross-Stack Workload Characterization of Deep Recommendation Systems},
  author = {Samuel Hsia and Udit Gupta and Mark Wilkening and Carole-Jean Wu and Gu-Yeon Wei and David Brooks},
  journal= {arXiv preprint arXiv:2010.05037},
  year   = {2020}
}

备注

Published in 2020 IEEE International Symposium on Workload Characterization (IISWC)